{"url":"/dataset/virtual-kitti","name":"Virtual KITTI","full_name":null,"description_markdown":"**Virtual KITTI** is a photo-realistic synthetic video dataset designed to learn and evaluate computer vision models for several video understanding tasks: object detection and multi-object tracking, scene-level and instance-level semantic segmentation, optical flow, and depth estimation.\r\n\r\nVirtual KITTI contains 50 high-resolution monocular videos (21,260 frames) generated from five different virtual worlds in urban settings under different imaging and weather conditions. These worlds were created using the Unity game engine and a novel real-to-virtual cloning method. These photo-realistic synthetic videos are automatically, exactly, and fully annotated for 2D and 3D multi-object tracking and at the pixel level with category, instance, flow, and depth labels (cf. below for download links).\r\n\r\nSource: [https://europe.naverlabs.com/research/computer-vision/proxy-virtual-worlds-vkitti-1/](https://europe.naverlabs.com/research/computer-vision/proxy-virtual-worlds-vkitti-1/)\r\nImage Source: [https://arxiv.org/pdf/1605.06457.pdf](https://arxiv.org/pdf/1605.06457.pdf)","description_withheld":null,"homepage":"https://europe.naverlabs.com/research/computer-vision/proxy-virtual-worlds-vkitti-1/","introduced_date":"2016-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/virtual-worlds-as-proxy-for-multi-object","title":"Virtual Worlds as Proxy for Multi-Object Tracking Analysis","first_author":"Adrien Gaidon","url":null},"license":{"name":"Creative Commons Attribution-NonCommercial-ShareAlike 3.0","url":"http://creativecommons.org/licenses/by-nc-sa/3.0/legalcode"},"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Videos","url":"/datasets/modality/videos"}],"tasks":[{"name":"Semantic Segmentation","url":"/task/semantic-segmentation","datasets_with_task":"/datasets/task/semantic-segmentation"},{"name":"Object Tracking","url":"/task/object-tracking","datasets_with_task":"/datasets/task/object-tracking"},{"name":"Depth Estimation","url":"/task/depth-estimation","datasets_with_task":"/datasets/task/depth-estimation"},{"name":"Multi-Object Tracking","url":"/task/multi-object-tracking","datasets_with_task":"/datasets/task/multi-object-tracking"},{"name":"Monocular Depth Estimation","url":"/task/monocular-depth-estimation","datasets_with_task":"/datasets/task/monocular-depth-estimation"},{"name":"Monocular 3D Object Detection","url":"/task/monocular-3d-object-detection","datasets_with_task":"/datasets/task/monocular-3d-object-detection"},{"name":"Autonomous Driving","url":"/task/autonomous-driving","datasets_with_task":"/datasets/task/autonomous-driving"},{"name":"Optical Flow Estimation","url":"/task/optical-flow-estimation","datasets_with_task":"/datasets/task/optical-flow-estimation"},{"name":"Visual Odometry","url":"/task/visual-odometry","datasets_with_task":"/datasets/task/visual-odometry"},{"name":"Simultaneous Localization and Mapping","url":"/task/simultaneous-localization-and-mapping","datasets_with_task":"/datasets/task/simultaneous-localization-and-mapping"},{"name":"Stereo Matching","url":"/task/stereo-matching-1","datasets_with_task":"/datasets/task/stereo-matching-1"}],"languages":[],"variants":["Virtual KITTI to BDD100K","Virtual KITTI 2","Virtual KITTI"],"data_loaders":[],"num_papers_in_archive":133,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}