{"url":"/task/visual-object-tracking","name":"Visual Object Tracking","slug":"visual-object-tracking","description_markdown":"**Visual Object Tracking** is an important research topic in computer vision, image understanding and pattern recognition. Given the initial state (centre location and scale) of a target in the first frame of a video sequence, the aim of Visual Object Tracking is to automatically obtain the states of the object in the subsequent video frames.\n\n\n<span class=\"description-source\">Source: [Learning Adaptive Discriminative Correlation Filters via Temporal Consistency Preserving Spatial Feature Selection for Robust Visual Object Tracking ](https://arxiv.org/abs/1807.11348)</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":341,"papers_with_code":187,"benchmarks":25,"benchmark_tables_in_archive":25,"benchmark_tables_shown":25,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":29,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/visual-object-tracking-on-lasot","slug":"visual-object-tracking-on-lasot","dataset":"LaSOT","dataset_url":"/dataset/lasot","rows_in_archive":46,"metrics":["AUC","Normalized Precision","Precision"],"first_row_in_archive_order":{"model":"SPMTrack-G","paper_title":"SPMTrack: Spatio-Temporal Parameter-Efficient Fine-Tuning with Mixture of Experts for Scalable Visual Tracking","paper_url":"/paper/spmtrack-spatio-temporal-parameter-efficient","paper_date":"2025-03-24","arxiv_id":"2503.18338","code_links":[{"title":"wenruicai/spmtrack","url":"https://github.com/wenruicai/spmtrack"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-got-10k","slug":"visual-object-tracking-on-got-10k","dataset":"GOT-10k","dataset_url":"/dataset/got-10k","rows_in_archive":42,"metrics":["Average Overlap","Success Rate 0.5","Success Rate 0.75"],"first_row_in_archive_order":{"model":"SAMURAI-L","paper_title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","paper_url":"/paper/samurai-adapting-segment-anything-model-for-1","paper_date":"2024-11-18","arxiv_id":"2411.11922","code_links":[{"title":"yangchris11/samurai","url":"https://github.com/yangchris11/samurai"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-trackingnet","slug":"visual-object-tracking-on-trackingnet","dataset":"TrackingNet","dataset_url":"/dataset/trackingnet","rows_in_archive":40,"metrics":["Accuracy","Normalized Precision","Precision","Success Rate","AUC"],"first_row_in_archive_order":{"model":"MCITrack-L384","paper_title":"Exploring Enhanced Contextual Information for Video-Level Object Tracking","paper_url":"/paper/exploring-enhanced-contextual-information-for-1","paper_date":"2024-12-15","arxiv_id":"2412.11023","code_links":[{"title":"kangben258/MCITrack","url":"https://github.com/kangben258/MCITrack"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-lasot-ext","slug":"visual-object-tracking-on-lasot-ext","dataset":"LaSOT-ext","dataset_url":null,"rows_in_archive":18,"metrics":["AUC","Normalized Precision","Precision"],"first_row_in_archive_order":{"model":"SAMURAI-L","paper_title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","paper_url":"/paper/samurai-adapting-segment-anything-model-for-1","paper_date":"2024-11-18","arxiv_id":"2411.11922","code_links":[{"title":"yangchris11/samurai","url":"https://github.com/yangchris11/samurai"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-otb-2015","slug":"visual-object-tracking-on-otb-2015","dataset":"OTB-2015","dataset_url":"/dataset/otb-2015","rows_in_archive":18,"metrics":["AUC","Precision"],"first_row_in_archive_order":{"model":"SPMTrack-B","paper_title":"SPMTrack: Spatio-Temporal Parameter-Efficient Fine-Tuning with Mixture of Experts for Scalable Visual Tracking","paper_url":"/paper/spmtrack-spatio-temporal-parameter-efficient","paper_date":"2025-03-24","arxiv_id":"2503.18338","code_links":[{"title":"wenruicai/spmtrack","url":"https://github.com/wenruicai/spmtrack"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-tnl2k","slug":"visual-object-tracking-on-tnl2k","dataset":"TNL2K","dataset_url":"/dataset/tnl2k","rows_in_archive":16,"metrics":["AUC","precision","Normalized Precision"],"first_row_in_archive_order":{"model":"MCITrack-L384","paper_title":"Exploring Enhanced Contextual Information for Video-Level Object Tracking","paper_url":"/paper/exploring-enhanced-contextual-information-for-1","paper_date":"2024-12-15","arxiv_id":"2412.11023","code_links":[{"title":"kangben258/MCITrack","url":"https://github.com/kangben258/MCITrack"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-uav123","slug":"visual-object-tracking-on-uav123","dataset":"UAV123","dataset_url":"/dataset/uav123","rows_in_archive":16,"metrics":["AUC","Precision"],"first_row_in_archive_order":{"model":"LoRAT-g-378","paper_title":"Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance","paper_url":"/paper/tracking-meets-lora-faster-training-larger","paper_date":"2024-03-08","arxiv_id":"2403.05231","code_links":[{"title":"litinglin/lorat","url":"https://github.com/litinglin/lorat"}],"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-vot201718","slug":"visual-object-tracking-on-vot201718","dataset":"VOT2017/18","dataset_url":"/dataset/vot2017","rows_in_archive":15,"metrics":["Expected Average Overlap (EAO)"],"first_row_in_archive_order":{"model":"SiamMask_E","paper_title":"Fast Visual Object Tracking with Rotated Bounding Boxes","paper_url":"/paper/fast-visual-object-tracking-with-rotated","paper_date":"2019-07-08","arxiv_id":"1907.03892","code_links":[{"title":"baoxinchen/siammask_e","url":"https://github.com/baoxinchen/siammask_e"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-didi","slug":"visual-object-tracking-on-didi","dataset":"DiDi","dataset_url":"/dataset/didi","rows_in_archive":11,"metrics":["Tracking quality"],"first_row_in_archive_order":{"model":"DAM4SAM","paper_title":"A Distractor-Aware Memory for Visual Object Tracking with SAM2","paper_url":"/paper/a-distractor-aware-memory-for-visual-object","paper_date":"2024-11-26","arxiv_id":"2411.17576","code_links":[{"title":"jovanavidenovic/dam4sam","url":"https://github.com/jovanavidenovic/dam4sam"}],"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":11}}},{"leaderboard":"/sota/visual-object-tracking-on-needforspeed","slug":"visual-object-tracking-on-needforspeed","dataset":"NeedForSpeed","dataset_url":null,"rows_in_archive":10,"metrics":["AUC"],"first_row_in_archive_order":{"model":"SAMURAI-L","paper_title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","paper_url":"/paper/samurai-adapting-segment-anything-model-for-1","paper_date":"2024-11-18","arxiv_id":"2411.11922","code_links":[{"title":"yangchris11/samurai","url":"https://github.com/yangchris11/samurai"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-youtube-vos","slug":"visual-object-tracking-on-youtube-vos","dataset":"YouTube-VOS 2018","dataset_url":"/dataset/youtube-vos","rows_in_archive":9,"metrics":["O (Average of Measures)","Jaccard (Seen)","Jaccard (Unseen)","F-Measure (Seen)","F-Measure (Unseen)"],"first_row_in_archive_order":{"model":"OSVOS","paper_title":"One-Shot Video Object Segmentation","paper_url":"/paper/one-shot-video-object-segmentation","paper_date":"2016-11-16","arxiv_id":"1611.05198","code_links":[{"title":"kmaninis/OSVOS-PyTorch","url":"https://github.com/kmaninis/OSVOS-PyTorch"},{"title":"scaelles/OSVOS-TensorFlow","url":"https://github.com/scaelles/OSVOS-TensorFlow"},{"title":"kmaninis/OSVOS-caffe","url":"https://github.com/kmaninis/OSVOS-caffe"},{"title":"xiuyu0000/new_papers_codes","url":"https://github.com/xiuyu0000/new_papers_codes/tree/main/OSVOS"},{"title":"code-implementation1/Code6","url":"https://github.com/code-implementation1/Code6/tree/main/OSVOS"},{"title":"MS-Mind/MS-Code-06","url":"https://github.com/MS-Mind/MS-Code-06/tree/main/OSVOS"},{"title":"2023-MindSpore-1/ms-code-215","url":"https://github.com/2023-MindSpore-1/ms-code-215/tree/main/OSVOS"},{"title":"Mind23-2/MindCode-5","url":"https://github.com/Mind23-2/MindCode-5/tree/main/OSVOS"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-avist","slug":"visual-object-tracking-on-avist","dataset":"AVisT","dataset_url":"/dataset/avist","rows_in_archive":7,"metrics":["Success Rate"],"first_row_in_archive_order":{"model":"PiVOT-L","paper_title":"Improving Visual Object Tracking through Visual Prompting","paper_url":"/paper/improving-visual-object-tracking-through","paper_date":"2024-09-27","arxiv_id":"2409.18901","code_links":[{"title":"chenshihfang/GOT","url":"https://github.com/chenshihfang/GOT"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-otb-2013","slug":"visual-object-tracking-on-otb-2013","dataset":"OTB-2013","dataset_url":"/dataset/otb-2013","rows_in_archive":7,"metrics":["AUC"],"first_row_in_archive_order":{"model":"SE-SiamFC","paper_title":"Scale Equivariance Improves Siamese Tracking","paper_url":"/paper/scale-equivariance-improves-siamese-tracking","paper_date":"2020-07-17","arxiv_id":"2007.09115","code_links":[{"title":"isosnovik/SiamSE","url":"https://github.com/isosnovik/SiamSE"}],"syntology":{"n":12,"n_ran":1,"n_unverified":11,"n_pointer_only":11}}},{"leaderboard":"/sota/visual-object-tracking-on-vot2016","slug":"visual-object-tracking-on-vot2016","dataset":"VOT2016","dataset_url":"/dataset/vot2016","rows_in_archive":6,"metrics":["Expected Average Overlap (EAO)"],"first_row_in_archive_order":{"model":"SiamMask_E","paper_title":"Fast Visual Object Tracking with Rotated Bounding Boxes","paper_url":"/paper/fast-visual-object-tracking-with-rotated","paper_date":"2019-07-08","arxiv_id":"1907.03892","code_links":[{"title":"baoxinchen/siammask_e","url":"https://github.com/baoxinchen/siammask_e"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-vot2017","slug":"visual-object-tracking-on-vot2017","dataset":"VOT2017","dataset_url":"/dataset/vot2017","rows_in_archive":6,"metrics":["Expected Average Overlap (EAO)"],"first_row_in_archive_order":{"model":"GFS-DCF","paper_title":"Joint Group Feature Selection and Discriminative Filter Learning for Robust Visual Object Tracking","paper_url":"/paper/joint-group-feature-selection-and","paper_date":"2019-07-30","arxiv_id":"1907.13242","code_links":[{"title":"XU-TIANYANG/GFS-DCF","url":"https://github.com/XU-TIANYANG/GFS-DCF"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-vot2022","slug":"visual-object-tracking-on-vot2022","dataset":"VOT2022","dataset_url":"/dataset/vot2022","rows_in_archive":5,"metrics":["EAO"],"first_row_in_archive_order":{"model":"DAM4SAM","paper_title":"A Distractor-Aware Memory for Visual Object Tracking with SAM2","paper_url":"/paper/a-distractor-aware-memory-for-visual-object","paper_date":"2024-11-26","arxiv_id":"2411.17576","code_links":[{"title":"jovanavidenovic/dam4sam","url":"https://github.com/jovanavidenovic/dam4sam"}],"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":11}}},{"leaderboard":"/sota/visual-object-tracking-on-otb-50","slug":"visual-object-tracking-on-otb-50","dataset":"OTB-50","dataset_url":"/dataset/otb","rows_in_archive":4,"metrics":["AUC"],"first_row_in_archive_order":{"model":"SiamVGG","paper_title":"SiamVGG: Visual Tracking using Deeper Siamese Networks","paper_url":"/paper/siamvgg-visual-tracking-using-deeper-siamese","paper_date":"2019-02-07","arxiv_id":"1902.02804","code_links":[{"title":"zllrunning/SiameseX.PyTorch","url":"https://github.com/zllrunning/SiameseX.PyTorch"},{"title":"leeyeehoo/SiamVGG","url":"https://github.com/leeyeehoo/SiamVGG"},{"title":"logiklesuraj/siamfcex","url":"https://github.com/logiklesuraj/siamfcex"},{"title":"logiklesuraj/SiamFC","url":"https://github.com/logiklesuraj/SiamFC"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-vot2019","slug":"visual-object-tracking-on-vot2019","dataset":"VOT2019","dataset_url":"/dataset/vot2019","rows_in_archive":3,"metrics":["Expected Average Overlap (EAO)","Accuracy"],"first_row_in_archive_order":{"model":"TREG","paper_title":"Target Transformed Regression for Accurate Tracking","paper_url":"/paper/target-transformed-regression-for-accurate","paper_date":"2021-04-01","arxiv_id":"2104.00403","code_links":[{"title":"MCG-NJU/TREG","url":"https://github.com/MCG-NJU/TREG"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-otb-100","slug":"visual-object-tracking-on-otb-100","dataset":"OTB-100","dataset_url":null,"rows_in_archive":2,"metrics":["AUC"],"first_row_in_archive_order":{"model":"DiMP-NCE+","paper_title":"How to Train Your Energy-Based Model for Regression","paper_url":"/paper/how-to-train-your-energy-based-model-for","paper_date":"2020-05-04","arxiv_id":"2005.01698","code_links":[{"title":"fregu856/ebms_regression","url":"https://github.com/fregu856/ebms_regression"},{"title":"soran-ghaderi/torchebm","url":"https://github.com/soran-ghaderi/torchebm"}],"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/visual-object-tracking-on-vot2018","slug":"visual-object-tracking-on-vot2018","dataset":"VOT2018","dataset_url":"/dataset/vot2018","rows_in_archive":2,"metrics":["Expected Average Overlap (EAO)","Accuracy"],"first_row_in_archive_order":{"model":"TREG","paper_title":"Target Transformed Regression for Accurate Tracking","paper_url":"/paper/target-transformed-regression-for-accurate","paper_date":"2021-04-01","arxiv_id":"2104.00403","code_links":[{"title":"MCG-NJU/TREG","url":"https://github.com/MCG-NJU/TREG"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-youtube-vos-1","slug":"visual-object-tracking-on-youtube-vos-1","dataset":"YouTube-VOS","dataset_url":"/dataset/youtube-vos","rows_in_archive":2,"metrics":["F-Measure (Seen)","F-Measure (Unseen)","Jaccard (Seen)","Jaccard (Unseen)","O (Average of Measures)"],"first_row_in_archive_order":{"model":"AOC-MF","paper_title":"Towards Robust Video Object Segmentation with Adaptive Object Calibration","paper_url":"/paper/towards-robust-video-object-segmentation-with","paper_date":"2022-07-02","arxiv_id":"2207.00887","code_links":[{"title":"jerryx1110/robust-video-object-segmentation","url":"https://github.com/jerryx1110/robust-video-object-segmentation"}],"syntology":{"n":4,"n_ran":2,"n_unverified":2,"n_pointer_only":4}}},{"leaderboard":"/sota/visual-object-tracking-on-itb","slug":"visual-object-tracking-on-itb","dataset":"ITB","dataset_url":"/dataset/itb","rows_in_archive":1,"metrics":["AUC"],"first_row_in_archive_order":{"model":"DropTrack","paper_title":"DropMAE: Masked Autoencoders with Spatial-Attention Dropout for Tracking Tasks","paper_url":"/paper/dropmae-masked-autoencoders-with-spatial","paper_date":"2023-04-02","arxiv_id":"2304.00571","code_links":[{"title":"jimmy-dq/dropmae","url":"https://github.com/jimmy-dq/dropmae"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-templecolor128","slug":"visual-object-tracking-on-templecolor128","dataset":"TempleColor128","dataset_url":null,"rows_in_archive":1,"metrics":["AUC","Precision"],"first_row_in_archive_order":{"model":"AAA","paper_title":"AAA: Adaptive Aggregation of Arbitrary Online Trackers with Theoretical Performance Guarantee","paper_url":"/paper/aaa-adaptive-aggregation-of-arbitrary-online","paper_date":"2020-09-19","arxiv_id":"2009.09237","code_links":[{"title":"songheony/A3T","url":"https://github.com/songheony/A3T"},{"title":"songheony/AAA-journal","url":"https://github.com/songheony/AAA-journal"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-videocube","slug":"visual-object-tracking-on-videocube","dataset":"VideoCube","dataset_url":"/dataset/videocube","rows_in_archive":1,"metrics":["Normalized Precision","Precision","Success Rate"],"first_row_in_archive_order":{"model":"RTracker-L","paper_title":"RTracker: Recoverable Tracking via PN Tree Structured Memory","paper_url":"/paper/rtracker-recoverable-tracking-via-pn-tree","paper_date":"2024-03-28","arxiv_id":"2403.19242","code_links":[{"title":"norahgreen/rtracker","url":"https://github.com/norahgreen/rtracker"}],"syntology":null}},{"leaderboard":"/sota/visual-object-tracking-on-vot2014","slug":"visual-object-tracking-on-vot2014","dataset":"VOT2014","dataset_url":"/dataset/vot2014","rows_in_archive":1,"metrics":["Expected Average Overlap (EAO)"],"first_row_in_archive_order":{"model":null,"paper_title":"Efficient Counterfactual Learning from Bandit Feedback","paper_url":"/paper/efficient-counterfactual-learning-from-bandit","paper_date":"2018-09-10","arxiv_id":"1809.03084","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/otb","name":"OTB","full_name":"","num_papers_in_archive":416},{"url":"/dataset/lasot","name":"LaSOT","full_name":"Large-scale Single Object Tracking","num_papers_in_archive":275},{"url":"/dataset/got-10k","name":"GOT-10k","full_name":"Generic Object Tracking Benchmark","num_papers_in_archive":239},{"url":"/dataset/trackingnet","name":"TrackingNet","full_name":"","num_papers_in_archive":210},{"url":"/dataset/youtube-vos","name":"YouTube-VOS 2018","full_name":"Youtube Video Object Segmentation","num_papers_in_archive":203},{"url":"/dataset/otb-2015","name":"OTB-2015","full_name":"","num_papers_in_archive":182},{"url":"/dataset/vot2018","name":"VOT2018","full_name":"VOT2018","num_papers_in_archive":129},{"url":"/dataset/vot2016","name":"VOT2016","full_name":"VOT2016","num_papers_in_archive":113},{"url":"/dataset/otb-2013","name":"OTB-2013","full_name":"","num_papers_in_archive":110},{"url":"/dataset/tnl2k","name":"TNL2K","full_name":"Tracking by natural language","num_papers_in_archive":62},{"url":"/dataset/vot2017","name":"VOT2017","full_name":"Visual Object Tracking Challenge","num_papers_in_archive":56},{"url":"/dataset/vot","name":"VOTChallenge","full_name":"Visual Object Tracking","num_papers_in_archive":36},{"url":"/dataset/uav123","name":"UAV123","full_name":"","num_papers_in_archive":20},{"url":"/dataset/cdtb","name":"CDTB","full_name":"Color-and-Depth Tracking","num_papers_in_archive":17},{"url":"/dataset/tlp","name":"TLP","full_name":"Track Long and Prosper","num_papers_in_archive":14},{"url":"/dataset/vot2014","name":"VOT2014","full_name":"Visual Object Tracking Challenge 2014","num_papers_in_archive":12},{"url":"/dataset/didi","name":"DiDi","full_name":"Distractor Distilled Dataset","num_papers_in_archive":10},{"url":"/dataset/vot2020","name":"VOT2020","full_name":"","num_papers_in_archive":9},{"url":"/dataset/avist","name":"AVisT","full_name":"A Benchmark for Visual Object Tracking in Adverse Visibility","num_papers_in_archive":7},{"url":"/dataset/trek150","name":"TREK-150","full_name":"","num_papers_in_archive":7},{"url":"/dataset/vot2022","name":"VOT2022","full_name":"","num_papers_in_archive":7},{"url":"/dataset/videocube","name":"VideoCube","full_name":"","num_papers_in_archive":6},{"url":"/dataset/rf100","name":"RF100","full_name":"Roboflow 100","num_papers_in_archive":5},{"url":"/dataset/vot2019","name":"VOT2019","full_name":null,"num_papers_in_archive":4},{"url":"/dataset/au-air","name":"AU-AIR","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/itb","name":"ITB","full_name":"Informative Tracking Benchmark","num_papers_in_archive":2},{"url":"/dataset/rgbd1k","name":"RGBD1K","full_name":"A Large-scale Dataset and Benchmark for RGB-D Object Tracking","num_papers_in_archive":2},{"url":"/dataset/biodrone","name":"BioDrone","full_name":"","num_papers_in_archive":1},{"url":"/dataset/sotverse","name":"SOTVerse","full_name":"","num_papers_in_archive":1}],"subtasks":[{"url":"/task/zero-shot-single-object-tracking","name":"Zero-Shot Single Object Tracking"}],"parent_tasks":[{"url":"/task/object-tracking","name":"Object Tracking"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":187,"tagged_in_all":341,"items":[{"url":"/paper/ssd-single-shot-multibox-detector","title":"SSD: Single Shot MultiBox Detector","date":"2015-12-08","arxiv_id":"1512.02325","repositories_listed":221,"syntology":{"n":131,"n_ran":19,"n_unverified":112,"n_pointer_only":5}},{"url":"/paper/siamrpn-evolution-of-siamese-visual-tracking","title":"SiamRPN++: Evolution of Siamese Visual Tracking with Very Deep Networks","date":"2018-12-31","arxiv_id":"1812.11703","repositories_listed":13,"syntology":{"n":17,"n_ran":3,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/2408-00714","title":"SAM 2: Segment Anything in Images and Videos","date":"2024-08-01","arxiv_id":"2408.00714","repositories_listed":11,"syntology":{"n":49,"n_ran":28,"n_unverified":21,"n_pointer_only":0}},{"url":"/paper/one-shot-video-object-segmentation","title":"One-Shot Video Object Segmentation","date":"2016-11-16","arxiv_id":"1611.05198","repositories_listed":8,"syntology":null},{"url":"/paper/siamfc-towards-robust-and-accurate-visual","title":"SiamFC++: Towards Robust and Accurate Visual Tracking with Target Estimation Guidelines","date":"2019-11-14","arxiv_id":"1911.06188","repositories_listed":6,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/awesome-multi-modal-object-tracking","title":"Awesome Multi-modal Object Tracking","date":"2024-05-23","arxiv_id":"2405.14200","repositories_listed":5,"syntology":null},{"url":"/paper/rethinking-self-supervised-correspondence","title":"Rethinking Self-supervised Correspondence Learning: A Video Frame-level Similarity Perspective","date":"2021-03-31","arxiv_id":"2103.17263","repositories_listed":5,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/deeper-and-wider-siamese-networks-for-real","title":"Deeper and Wider Siamese Networks for Real-Time Visual Tracking","date":"2019-01-07","arxiv_id":"1901.01660","repositories_listed":5,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/high-performance-visual-tracking-with-siamese","title":"High Performance Visual Tracking With Siamese Region Proposal Network","date":"2018-06-01","arxiv_id":null,"repositories_listed":5,"syntology":null},{"url":"/paper/eco-efficient-convolution-operators-for","title":"ECO: Efficient Convolution Operators for Tracking","date":"2016-11-28","arxiv_id":"1611.09224","repositories_listed":5,"syntology":null},{"url":"/paper/event-stream-based-visual-object-tracking-a","title":"Event Stream-based Visual Object Tracking: A High-Resolution Benchmark Dataset and A Novel Baseline","date":"2023-09-26","arxiv_id":"2309.14611","repositories_listed":4,"syntology":{"n":9,"n_ran":9,"n_unverified":0,"n_pointer_only":9}},{"url":"/paper/procontext-exploring-progressive-context","title":"ProContEXT: Exploring Progressive Context Transformer for Tracking","date":"2022-10-27","arxiv_id":"2210.15511","repositories_listed":4,"syntology":null},{"url":"/paper/ocean-object-aware-anchor-free-tracking","title":"Ocean: Object-aware Anchor-free Tracking","date":"2020-06-18","arxiv_id":"2006.10721","repositories_listed":4,"syntology":null},{"url":"/paper/siamvgg-visual-tracking-using-deeper-siamese","title":"SiamVGG: Visual Tracking using Deeper Siamese Networks","date":"2019-02-07","arxiv_id":"1902.02804","repositories_listed":4,"syntology":null},{"url":"/paper/atom-accurate-tracking-by-overlap","title":"ATOM: Accurate Tracking by Overlap Maximization","date":"2018-11-19","arxiv_id":"1811.07628","repositories_listed":4,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/youtube-vos-sequence-to-sequence-video-object","title":"YouTube-VOS: Sequence-to-Sequence Video Object Segmentation","date":"2018-09-03","arxiv_id":"1809.00461","repositories_listed":4,"syntology":null},{"url":"/paper/discriminative-correlation-filter-with","title":"Discriminative Correlation Filter with Channel and Spatial Reliability","date":"2016-11-25","arxiv_id":"1611.08461","repositories_listed":4,"syntology":null},{"url":"/paper/fast-online-object-tracking-and-segmentation","title":"Fast Online Object Tracking and Segmentation: A Unifying Approach","date":"2018-12-12","arxiv_id":"1812.05050","repositories_listed":3,"syntology":{"n":10,"n_ran":1,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/staple-complementary-learners-for-real-time","title":"Staple: Complementary Learners for Real-Time Tracking","date":"2015-12-04","arxiv_id":"1512.01355","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/towards-underwater-camouflaged-object","title":"Underwater Camouflaged Object Tracking Meets Vision-Language SAM2","date":"2024-09-25","arxiv_id":"2409.16902","repositories_listed":2,"syntology":null},{"url":"/paper/vasttrack-vast-category-visual-object","title":"VastTrack: Vast Category Visual Object Tracking","date":"2024-03-06","arxiv_id":"2403.03493","repositories_listed":2,"syntology":null},{"url":"/paper/spatio-temporal-prompting-network-for-robust-1","title":"Spatio-temporal Prompting Network for Robust Video Feature Extraction","date":"2024-02-04","arxiv_id":"2402.02574","repositories_listed":2,"syntology":null},{"url":"/paper/towards-sequence-level-training-for-visual","title":"Towards Sequence-Level Training for Visual Tracking","date":"2022-08-11","arxiv_id":"2208.05810","repositories_listed":2,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":5}},{"url":"/paper/robust-visual-tracking-by-segmentation","title":"Robust Visual Tracking by Segmentation","date":"2022-03-21","arxiv_id":"2203.11191","repositories_listed":2,"syntology":null},{"url":"/paper/you-only-demonstrate-once-category-level","title":"You Only Demonstrate Once: Category-Level Manipulation from Single Visual Demonstration","date":"2022-01-30","arxiv_id":"2201.12716","repositories_listed":2,"syntology":{"n":30,"n_ran":4,"n_unverified":26,"n_pointer_only":0}},{"url":"/paper/efficient-visual-tracking-with-exemplar","title":"Efficient Visual Tracking with Exemplar Transformers","date":"2021-12-17","arxiv_id":"2112.09686","repositories_listed":2,"syntology":null},{"url":"/paper/associating-objects-with-transformers-for","title":"Associating Objects with Transformers for Video Object Segmentation","date":"2021-06-04","arxiv_id":"2106.02638","repositories_listed":2,"syntology":null},{"url":"/paper/towards-more-flexible-and-accurate-object","title":"Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and Benchmark","date":"2021-03-31","arxiv_id":"2103.16746","repositories_listed":2,"syntology":null},{"url":"/paper/rotation-equivariant-siamese-networks-for","title":"Rotation Equivariant Siamese Networks for Tracking","date":"2020-12-24","arxiv_id":"2012.13078","repositories_listed":2,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/multi-modal-visual-tracking-review-and","title":"Multi-modal Visual Tracking: Review and Experimental Comparison","date":"2020-12-08","arxiv_id":"2012.04176","repositories_listed":2,"syntology":null}],"syntology_records":13,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}