{"url":"/task/visual-tracking","name":"Visual Tracking","slug":"visual-tracking","description_markdown":"**Visual Tracking** is an essential and actively researched problem in the field of computer vision with various real-world applications such as robotic services, smart surveillance systems, autonomous driving, and human-computer interaction. It refers to the automatic estimation of the trajectory of an arbitrary target object, usually specified by a bounding box in the first frame, as it moves around in subsequent video frames.\n\n\n<span class=\"description-source\">Source: [Learning Reinforced Attentional Representation for End-to-End Visual Tracking ](https://arxiv.org/abs/1908.10009)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":525,"papers_with_code":202,"benchmarks":10,"benchmark_tables_in_archive":10,"benchmark_tables_shown":10,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":28,"subtasks":4,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/visual-tracking-on-tnl2k","slug":"visual-tracking-on-tnl2k","dataset":"TNL2K","dataset_url":"/dataset/tnl2k","rows_in_archive":6,"metrics":["AUC","precision"],"first_row_in_archive_order":{"model":"ARTrack-L","paper_title":"Autoregressive Visual Tracking","paper_url":"/paper/autoregressive-visual-tracking","paper_date":"2023-01-01","arxiv_id":null,"code_links":[{"title":"miv-xjtu/artrack","url":"https://github.com/miv-xjtu/artrack"}],"syntology":null}},{"leaderboard":"/sota/visual-tracking-on-davis","slug":"visual-tracking-on-davis","dataset":"DAVIS","dataset_url":"/dataset/davis","rows_in_archive":2,"metrics":["Average Jaccard"],"first_row_in_archive_order":{"model":"TAPIR (Panning MOVi-E)","paper_title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","paper_url":"/paper/tapir-tracking-any-point-with-per-frame","paper_date":"2023-06-14","arxiv_id":"2306.08637","code_links":[{"title":"deepmind/tapnet","url":"https://github.com/deepmind/tapnet"},{"title":"riponazad/echotracker","url":"https://github.com/riponazad/echotracker"},{"title":"ibaiGorordo/Tapir-Pytorch-Inference","url":"https://github.com/ibaiGorordo/Tapir-Pytorch-Inference"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-tracking-on-kinetics","slug":"visual-tracking-on-kinetics","dataset":"Kinetics","dataset_url":"/dataset/kinetics","rows_in_archive":2,"metrics":["Average Jaccard"],"first_row_in_archive_order":{"model":"TAPIR (Panning MOVi-E)","paper_title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","paper_url":"/paper/tapir-tracking-any-point-with-per-frame","paper_date":"2023-06-14","arxiv_id":"2306.08637","code_links":[{"title":"deepmind/tapnet","url":"https://github.com/deepmind/tapnet"},{"title":"riponazad/echotracker","url":"https://github.com/riponazad/echotracker"},{"title":"ibaiGorordo/Tapir-Pytorch-Inference","url":"https://github.com/ibaiGorordo/Tapir-Pytorch-Inference"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-tracking-on-kubric","slug":"visual-tracking-on-kubric","dataset":"Kubric","dataset_url":"/dataset/kubric","rows_in_archive":2,"metrics":["Average Jaccard"],"first_row_in_archive_order":{"model":"TAPIR (Panning MOVi-E)","paper_title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","paper_url":"/paper/tapir-tracking-any-point-with-per-frame","paper_date":"2023-06-14","arxiv_id":"2306.08637","code_links":[{"title":"deepmind/tapnet","url":"https://github.com/deepmind/tapnet"},{"title":"riponazad/echotracker","url":"https://github.com/riponazad/echotracker"},{"title":"ibaiGorordo/Tapir-Pytorch-Inference","url":"https://github.com/ibaiGorordo/Tapir-Pytorch-Inference"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-tracking-on-rgb-stacking","slug":"visual-tracking-on-rgb-stacking","dataset":"RGB-Stacking","dataset_url":"/dataset/rgb-stacking","rows_in_archive":2,"metrics":["Average Jaccard"],"first_row_in_archive_order":{"model":"TAPIR (MOVi-E)","paper_title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","paper_url":"/paper/tapir-tracking-any-point-with-per-frame","paper_date":"2023-06-14","arxiv_id":"2306.08637","code_links":[{"title":"deepmind/tapnet","url":"https://github.com/deepmind/tapnet"},{"title":"riponazad/echotracker","url":"https://github.com/riponazad/echotracker"},{"title":"ibaiGorordo/Tapir-Pytorch-Inference","url":"https://github.com/ibaiGorordo/Tapir-Pytorch-Inference"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-tracking-on-lasot","slug":"visual-tracking-on-lasot","dataset":"LaSOT","dataset_url":"/dataset/lasot","rows_in_archive":1,"metrics":["AUC"],"first_row_in_archive_order":{"model":"TATrack-L","paper_title":"Target-Aware Tracking with Long-term Context Attention","paper_url":"/paper/target-aware-tracking-with-long-term-context","paper_date":"2023-02-27","arxiv_id":"2302.13840","code_links":[{"title":"hekaijie123/TATrack","url":"https://github.com/hekaijie123/TATrack"}],"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-tracking-on-otb-100","slug":"visual-tracking-on-otb-100","dataset":"OTB-100","dataset_url":null,"rows_in_archive":1,"metrics":["AUC"],"first_row_in_archive_order":{"model":"SiamFC-lu (Ours)","paper_title":"Learning to Update for Object Tracking with Recurrent Meta-learner","paper_url":"/paper/learning-to-update-for-object-tracking-with","paper_date":"2018-06-19","arxiv_id":"1806.07078","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-tracking-on-otb-2013","slug":"visual-tracking-on-otb-2013","dataset":"OTB-2013","dataset_url":"/dataset/otb-2013","rows_in_archive":1,"metrics":["AUC"],"first_row_in_archive_order":{"model":"SiamFC-lu (Ours)","paper_title":"Learning to Update for Object Tracking with Recurrent Meta-learner","paper_url":"/paper/learning-to-update-for-object-tracking-with","paper_date":"2018-06-19","arxiv_id":"1806.07078","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-tracking-on-second-dialogue-state","slug":"visual-tracking-on-second-dialogue-state","dataset":"Second dialogue state tracking challenge","dataset_url":"/dataset/dialogue-state-tracking-challenge","rows_in_archive":1,"metrics":["Score"],"first_row_in_archive_order":{"model":"MDNet","paper_title":"Learning Multi-Domain Convolutional Neural Networks for Visual Tracking","paper_url":"/paper/learning-multi-domain-convolutional-neural","paper_date":"2015-10-27","arxiv_id":"1510.07945","code_links":[{"title":"HyeonseobNam/py-MDNet","url":"https://github.com/HyeonseobNam/py-MDNet"},{"title":"FelixOliver/PROYECTO-FINAL-VOT","url":"https://github.com/FelixOliver/PROYECTO-FINAL-VOT"}],"syntology":null}},{"leaderboard":"/sota/visual-tracking-on-trackingnet","slug":"visual-tracking-on-trackingnet","dataset":"TrackingNet","dataset_url":"/dataset/trackingnet","rows_in_archive":1,"metrics":["ACCURACY","Normalized Precision"],"first_row_in_archive_order":{"model":"TATrack-L","paper_title":"Target-Aware Tracking with Long-term Context Attention","paper_url":"/paper/target-aware-tracking-with-long-term-context","paper_date":"2023-02-27","arxiv_id":"2302.13840","code_links":[{"title":"hekaijie123/TATrack","url":"https://github.com/hekaijie123/TATrack"}],"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/davis","name":"DAVIS","full_name":"Densely Annotated VIdeo Segmentation","num_papers_in_archive":734},{"url":"/dataset/otb","name":"OTB","full_name":"","num_papers_in_archive":416},{"url":"/dataset/lasot","name":"LaSOT","full_name":"Large-scale Single Object Tracking","num_papers_in_archive":275},{"url":"/dataset/trackingnet","name":"TrackingNet","full_name":"","num_papers_in_archive":210},{"url":"/dataset/otb-2015","name":"OTB-2015","full_name":"","num_papers_in_archive":182},{"url":"/dataset/otb-2013","name":"OTB-2013","full_name":"","num_papers_in_archive":110},{"url":"/dataset/kubric","name":"Kubric","full_name":"","num_papers_in_archive":77},{"url":"/dataset/tnl2k","name":"TNL2K","full_name":"Tracking by natural language","num_papers_in_archive":62},{"url":"/dataset/tap-vid","name":"TAP-Vid","full_name":"","num_papers_in_archive":46},{"url":"/dataset/vot","name":"VOTChallenge","full_name":"Visual Object Tracking","num_papers_in_archive":36},{"url":"/dataset/oxuva","name":"OxUva","full_name":"","num_papers_in_archive":34},{"url":"/dataset/dialogue-state-tracking-challenge","name":"Dialogue State Tracking Challenge","full_name":"Dialogue State Tracking Challenge","num_papers_in_archive":33},{"url":"/dataset/cdtb","name":"CDTB","full_name":"Color-and-Depth Tracking","num_papers_in_archive":17},{"url":"/dataset/tlp","name":"TLP","full_name":"Track Long and Prosper","num_papers_in_archive":14},{"url":"/dataset/rgb-stacking","name":"RGB-Stacking","full_name":"","num_papers_in_archive":13},{"url":"/dataset/vot2014","name":"VOT2014","full_name":"Visual Object Tracking Challenge 2014","num_papers_in_archive":12},{"url":"/dataset/youtube-boundingboxes","name":"YT-BB","full_name":"YouTube-BoundingBoxes","num_papers_in_archive":7},{"url":"/dataset/mmptrack","name":"MMPTRACK","full_name":"Multi-camera Multiple People Tracking Dataset","num_papers_in_archive":6},{"url":"/dataset/mdot","name":"MDOT","full_name":"","num_papers_in_archive":4},{"url":"/dataset/surgt","name":"SurgT","full_name":"","num_papers_in_archive":3},{"url":"/dataset/vbr","name":"VBR","full_name":"VBR: A Vision Benchmark in Rome","num_papers_in_archive":3},{"url":"/dataset/drunkard-s-dataset","name":"Drunkard's Dataset","full_name":"","num_papers_in_archive":2},{"url":"/dataset/arkittrack","name":"ARKitTrack","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ltft","name":"LTFT","full_name":"Long-Term Face Tracking","num_papers_in_archive":1},{"url":"/dataset/mobiface","name":"MobiFace","full_name":"MobiFace","num_papers_in_archive":1},{"url":"/dataset/salient-closed-boundary-tracking","name":"Salient Closed Boundary Tracking","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/trek-100","name":"TREK-100","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/point-tracking","name":"Point Tracking"},{"url":"/task/real-time-visual-tracking","name":"Real-Time Visual Tracking"},{"url":"/task/rf-based-visual-tracking","name":"RF-based Visual Tracking"},{"url":"/task/rgb-t-tracking","name":"Rgb-T Tracking"}],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":202,"tagged_in_all":525,"items":[{"url":"/paper/siamrpn-evolution-of-siamese-visual-tracking","title":"SiamRPN++: Evolution of Siamese Visual Tracking with Very Deep Networks","date":"2018-12-31","arxiv_id":"1812.11703","repositories_listed":13,"syntology":{"n":17,"n_ran":3,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/re3-real-time-recurrent-regression-networks","title":"Re3 : Real-Time Recurrent Regression Networks for Visual Tracking of Generic Objects","date":"2017-05-17","arxiv_id":"1705.06368","repositories_listed":11,"syntology":null},{"url":"/paper/siamfc-towards-robust-and-accurate-visual","title":"SiamFC++: Towards Robust and Accurate Visual Tracking with Target Estimation Guidelines","date":"2019-11-14","arxiv_id":"1911.06188","repositories_listed":6,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/deeper-and-wider-siamese-networks-for-real","title":"Deeper and Wider Siamese Networks for Real-Time Visual Tracking","date":"2019-01-07","arxiv_id":"1901.01660","repositories_listed":5,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/high-performance-visual-tracking-with-siamese","title":"High Performance Visual Tracking With Siamese Region Proposal Network","date":"2018-06-01","arxiv_id":null,"repositories_listed":5,"syntology":null},{"url":"/paper/dcfnet-discriminant-correlation-filters","title":"DCFNet: Discriminant Correlation Filters Network for Visual Tracking","date":"2017-04-13","arxiv_id":"1704.04057","repositories_listed":5,"syntology":null},{"url":"/paper/long-term-frame-event-visual-tracking","title":"Long-term Frame-Event Visual Tracking: Benchmark Dataset and Baseline","date":"2024-03-09","arxiv_id":"2403.05839","repositories_listed":4,"syntology":null},{"url":"/paper/event-stream-based-visual-object-tracking-a","title":"Event Stream-based Visual Object Tracking: A High-Resolution Benchmark Dataset and A Novel Baseline","date":"2023-09-26","arxiv_id":"2309.14611","repositories_listed":4,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}},{"url":"/paper/siamvgg-visual-tracking-using-deeper-siamese","title":"SiamVGG: Visual Tracking using Deeper Siamese Networks","date":"2019-02-07","arxiv_id":"1902.02804","repositories_listed":4,"syntology":null},{"url":"/paper/atom-accurate-tracking-by-overlap","title":"ATOM: Accurate Tracking by Overlap Maximization","date":"2018-11-19","arxiv_id":"1811.07628","repositories_listed":4,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/tapir-tracking-any-point-with-per-frame","title":"TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement","date":"2023-06-14","arxiv_id":"2306.08637","repositories_listed":3,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/fast-online-object-tracking-and-segmentation","title":"Fast Online Object Tracking and Segmentation: A Unifying Approach","date":"2018-12-12","arxiv_id":"1812.05050","repositories_listed":3,"syntology":{"n":10,"n_ran":1,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/learning-regression-and-verification-networks","title":"Learning regression and verification networks for long-term visual tracking","date":"2018-09-12","arxiv_id":"1809.04320","repositories_listed":3,"syntology":null},{"url":"/paper/real-time-mdnet","title":"Real-Time MDNet","date":"2018-08-27","arxiv_id":"1808.08834","repositories_listed":3,"syntology":null},{"url":"/paper/kernel-cross-correlator","title":"Kernel Cross-Correlator","date":"2017-09-12","arxiv_id":"1709.05936","repositories_listed":3,"syntology":null},{"url":"/paper/local-all-pair-correspondence-for-point","title":"Local All-Pair Correspondence for Point Tracking","date":"2024-07-22","arxiv_id":"2407.15420","repositories_listed":2,"syntology":{"n":12,"n_ran":6,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/towards-a-generalist-and-blind-rgb-x-tracker","title":"XTrack: Multimodal Training Boosts RGB-X Video Object Trackers","date":"2024-05-28","arxiv_id":"2405.17773","repositories_listed":2,"syntology":null},{"url":"/paper/vasttrack-vast-category-visual-object","title":"VastTrack: Vast Category Visual Object Tracking","date":"2024-03-06","arxiv_id":"2403.03493","repositories_listed":2,"syntology":null},{"url":"/paper/robust-visual-tracking-by-segmentation","title":"Robust Visual Tracking by Segmentation","date":"2022-03-21","arxiv_id":"2203.11191","repositories_listed":2,"syntology":null},{"url":"/paper/you-only-demonstrate-once-category-level","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","date":"2022-01-30","arxiv_id":"2201.12716","repositories_listed":2,"syntology":{"n":30,"n_ran":4,"n_unverified":26,"n_pointer_only":0}},{"url":"/paper/recursive-least-squares-estimator-aided-1","title":"Recursive Least-Squares Estimator-Aided Online Learning for Visual Tracking","date":"2021-12-28","arxiv_id":"2112.14016","repositories_listed":2,"syntology":null},{"url":"/paper/efficient-visual-tracking-with-exemplar","title":"Efficient Visual Tracking with Exemplar Transformers","date":"2021-12-17","arxiv_id":"2112.09686","repositories_listed":2,"syntology":null},{"url":"/paper/tracking-and-long-term-identification-using","title":"Persistent Animal Identification Leveraging Non-Visual Markers","date":"2021-12-13","arxiv_id":"2112.06809","repositories_listed":2,"syntology":null},{"url":"/paper/towards-more-flexible-and-accurate-object","title":"Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and Benchmark","date":"2021-03-31","arxiv_id":"2103.16746","repositories_listed":2,"syntology":null},{"url":"/paper/predictive-visual-tracking-a-new-benchmark","title":"Predictive Visual Tracking: A New Benchmark and Baseline Approach","date":"2021-03-08","arxiv_id":"2103.04508","repositories_listed":2,"syntology":null},{"url":"/paper/multi-modal-visual-tracking-review-and","title":"Multi-modal Visual Tracking: Review and Experimental Comparison","date":"2020-12-08","arxiv_id":"2012.04176","repositories_listed":2,"syntology":null},{"url":"/paper/how-to-train-your-energy-based-model-for","title":"How to Train Your Energy-Based Model for Regression","date":"2020-05-04","arxiv_id":"2005.01698","repositories_listed":2,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/fully-convolutional-online-tracking","title":"Fully Convolutional Online Tracking","date":"2020-04-15","arxiv_id":"2004.07109","repositories_listed":2,"syntology":null},{"url":"/paper/high-performance-long-term-tracking-with-meta","title":"High-Performance Long-Term Tracking with Meta-Updater","date":"2020-04-01","arxiv_id":"2004.00305","repositories_listed":2,"syntology":null},{"url":"/paper/probabilistic-regression-for-visual-tracking","title":"Probabilistic Regression for Visual Tracking","date":"2020-03-27","arxiv_id":"2003.12565","repositories_listed":2,"syntology":null}],"syntology_records":10,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}