{"url":"/dataset/trackingnet","name":"TrackingNet","full_name":null,"description_markdown":"**TrackingNet** is a large-scale tracking dataset consisting of videos in the wild. It has a total of 30,643 videos split into 30,132 training videos and 511 testing videos, with an average of 470,9 frames.\r\n\r\nSource: [Learning the Model Update for Siamese Trackers](https://arxiv.org/abs/1908.00855)\r\nImage Source: [https://arxiv.org/abs/1803.10794](https://arxiv.org/abs/1803.10794)","description_withheld":null,"homepage":"https://tracking-net.org/","introduced_date":"2018-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/trackingnet-a-large-scale-dataset-and","title":"TrackingNet: A Large-Scale Dataset and Benchmark for Object Tracking in the Wild","first_author":"Matthias Müller","url":null},"license":{"name":"Apache 2.0","url":null},"modalities":[{"name":"Images","url":"/datasets/modality/images"},{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Tracking","url":"/datasets/modality/tracking"}],"tasks":[{"name":"Visual Object Tracking","url":"/task/visual-object-tracking","datasets_with_task":"/datasets/task/visual-object-tracking"},{"name":"Visual Tracking","url":"/task/visual-tracking","datasets_with_task":"/datasets/task/visual-tracking"}],"languages":[],"variants":["TrackingNet"],"data_loaders":[],"num_papers_in_archive":210,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/visual-object-tracking-on-trackingnet","task":"Visual Object Tracking","dataset_variant":"TrackingNet","rows":40,"metrics":["Accuracy","Normalized Precision","Precision","Success Rate","AUC"],"first_row_in_archive_order":{"model":"MCITrack-L384","paper":"/paper/exploring-enhanced-contextual-information-for-1","metrics":{"Accuracy":"87.9","Normalized Precision":"92.1","Precision":"89.2"},"code_links":[{"title":"kangben258/MCITrack","url":"https://github.com/kangben258/MCITrack"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/visual-tracking-on-trackingnet","task":"Visual Tracking","dataset_variant":"TrackingNet","rows":1,"metrics":["ACCURACY","Normalized Precision"],"first_row_in_archive_order":{"model":"TATrack-L","paper":"/paper/target-aware-tracking-with-long-term-context","metrics":{"ACCURACY":"0.85","Normalized Precision":"89.3"},"code_links":[{"title":"hekaijie123/TATrack","url":"https://github.com/hekaijie123/TATrack"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/spmtrack-spatio-temporal-parameter-efficient","title":"SPMTrack: Spatio-Temporal Parameter-Efficient Fine-Tuning with Mixture of Experts for Scalable Visual Tracking","date":"2025-03-24","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/exploring-enhanced-contextual-information-for-1","title":"Exploring Enhanced Contextual Information for Video-Level Object Tracking","date":"2024-12-15","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/samurai-adapting-segment-anything-model-for-1","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","date":"2024-11-18","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tracking-meets-lora-faster-training-larger","title":"Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance","date":"2024-03-08","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/odtrack-online-dense-temporal-token-learning","title":"ODTrack: Online Dense Temporal Token Learning for Visual Tracking","date":"2024-01-03","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/artrackv2-prompting-autoregressive-tracker","title":"ARTrackV2: Prompting Autoregressive Tracker Where to Look and How to Describe","date":"2023-12-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-historical-status-prompt-for","title":"HIPTrack: Visual Tracking with Historical Prompts","date":"2023-11-03","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/integrating-boxes-and-masks-a-multi-object","title":"Integrating Boxes and Masks: A Multi-Object Framework for Unified Visual Tracking and Segmentation","date":"2023-08-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/seqtrack-sequence-to-sequence-learning-for","title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","date":"2023-04-27","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/dropmae-masked-autoencoders-with-spatial","title":"DropMAE: Masked Autoencoders with Spatial-Attention Dropout for Tracking Tasks","date":"2023-04-02","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/universal-instance-perception-as-object","title":"Universal Instance Perception as Object Discovery and Retrieval","date":"2023-03-12","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":3,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/target-aware-tracking-with-long-term-context","title":"Target-Aware Tracking with Long-term Context Attention","date":"2023-02-27","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mixformer-end-to-end-tracking-with-iterative-2","title":"MixFormer: End-to-End Tracking with Iterative Mixed Attention","date":"2023-02-06","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/autoregressive-visual-tracking","title":"Autoregressive Visual Tracking","date":"2023-01-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/neighbortrack-improving-single-object","title":"NeighborTrack: Improving Single Object Tracking by Bipartite Matching with Neighbor Tracklets","date":"2022-11-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/towards-sequence-level-training-for-visual","title":"Towards Sequence-Level Training for Visual Tracking","date":"2022-08-11","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":3,"samples_unverified":2,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/aiatrack-attention-in-attention-for","title":"AiATrack: Attention in Attention for Transformer Visual Tracking","date":"2022-07-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":1,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/towards-grand-unification-of-object-tracking","title":"Towards Grand Unification of Object Tracking","date":"2022-07-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":6,"samples_ran":6,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/joint-feature-learning-and-relation-modeling","title":"Joint Feature Learning and Relation Modeling for Tracking: A One-Stream Framework","date":"2022-03-22","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mixformer-end-to-end-tracking-with-iterative-1","title":"MixFormer: End-to-End Tracking with Iterative Mixed Attention","date":"2022-03-21","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":1,"samples_ran":1,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/swintrack-a-simple-and-strong-baseline-for","title":"SwinTrack: A Simple and Strong Baseline for Transformer Tracking","date":"2021-12-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":0,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/target-transformed-regression-for-accurate","title":"Target Transformed Regression for Accurate Tracking","date":"2021-04-01","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/learning-spatio-temporal-transformer-for","title":"Learning Spatio-Temporal Transformer for Visual Tracking","date":"2021-03-31","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/learning-to-fuse-asymmetric-feature-maps-in","title":"Learning to Fuse Asymmetric Feature Maps in Siamese Trackers","date":"2020-12-04","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/how-to-train-your-energy-based-model-for","title":"How to Train Your Energy-Based Model for Regression","date":"2020-05-04","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":0,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/siam-r-cnn-visual-tracking-by-re-detection","title":"Siam R-CNN: Visual Tracking by Re-Detection","date":"2019-11-28","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":4,"samples_ran":0,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/siamfc-towards-robust-and-accurate-visual","title":"SiamFC++: Towards Robust and Accurate Visual Tracking with Target Estimation Guidelines","date":"2019-11-14","rows_on_this_dataset":1,"code_links":6,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":5,"samples_ran":4,"samples_unverified":1,"pointer_only_for_licence":5,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/dctd-deep-conditional-target-densities-for","title":"Energy-Based Models for Deep Probabilistic Regression","date":"2019-09-26","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/joint-group-feature-selection-and","title":"Joint Group Feature Selection and Discriminative Filter Learning for Robust Visual Object Tracking","date":"2019-07-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/190407220","title":"Learning Discriminative Model Prediction for Tracking","date":"2019-04-15","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/siamrpn-evolution-of-siamese-visual-tracking","title":"SiamRPN++: Evolution of Siamese Visual Tracking with Very Deep Networks","date":"2018-12-31","rows_on_this_dataset":1,"code_links":13,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":3,"samples_unverified":14,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/atom-accurate-tracking-by-overlap","title":"ATOM: Accurate Tracking by Overlap Maximization","date":"2018-11-19","rows_on_this_dataset":1,"code_links":4,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":9,"samples_ran":3,"samples_unverified":6,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/eco-efficient-convolution-operators-for","title":"ECO: Efficient Convolution Operators for Tracking","date":"2016-11-28","rows_on_this_dataset":1,"code_links":5,"syntology":null},{"paper":"/paper/staple-complementary-learners-for-real-time","title":"Staple: Complementary Learners for Real-Time Tracking","date":"2015-12-04","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":3,"samples_ran":3,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":19,"samples_harvested":75,"samples_ran":34,"samples_unverified":41,"pointer_only_for_licence":11,"papers_with_no_sample_that_ran":6,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}