{"url":"/sota/rgb-t-tracking-on-rgbt234","task":{"name":"Rgb-T Tracking","url":"/task/rgb-t-tracking","note":null},"dataset":{"name":"RGBT234","url":"/dataset/rgbt234"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"RGBT tracking, or RGB-Thermal tracking, is a sophisticated method utilized in computer vision for tracking objects across both RGB and thermal infrared modalities. This technique combines information from both RGB and thermal imagery to enhance object detection and tracking performance, particularly in challenging environments where lighting conditions may vary or be limited. By integrating data from these two modalities, RGBT tracking systems can effectively compensate for the limitations of each individual modality, such as the inability of RGB cameras to capture clear images in low-light or adverse weather conditions, and the inability of thermal cameras to accurately identify object details. RGBT tracking algorithms typically involve sophisticated fusion techniques to combine information from RGB and thermal sensors, enabling robust and accurate object tracking in diverse scenarios ranging from surveillance and security applications to autonomous vehicles and search and rescue operations.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Precision","Success"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Precision":"higher","Success":"higher"}},"counts":{"rows":42,"rows_with_code":23,"rows_with_paper_page":40,"rows_dated":40,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"SUTrack-L224","metrics":{"Precision":"94.6","Success":"70.8"},"uses_additional_data":false,"paper_date":"2024-12-26","paper":"/paper/sutrack-towards-simple-and-unified-single","paper_url":"https://arxiv.org/abs/2412.19138v1","paper_title":"SUTrack: Towards Simple and Unified Single Object Tracking","code":"https://github.com/chenxin-dlut/sutrack","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"FlexTrack","metrics":{"Precision":"92.7","Success":"69.9"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"SeqTrackv2-L256","metrics":{"Precision":"92.3","Success":"68.5"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/seqtrack-sequence-to-sequence-learning-for","paper_url":"https://arxiv.org/abs/2304.14394v3","paper_title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","code":"https://github.com/chenxin-dlut/seqtrackv2","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"PromptTrack","metrics":{"Precision":"91.7","Success":"67.2"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"SeqTrackv2-L384","metrics":{"Precision":"91.3","Success":"68.0"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/seqtrack-sequence-to-sequence-learning-for","paper_url":"https://arxiv.org/abs/2304.14394v3","paper_title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","code":"https://github.com/chenxin-dlut/seqtrackv2","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"MambaVT-M256","metrics":{"Precision":"90.7","Success":"67.5"},"uses_additional_data":false,"paper_date":"2024-08-15","paper":"/paper/mambavt-spatio-temporal-contextual-modeling","paper_url":"https://arxiv.org/abs/2408.07889v1","paper_title":"MambaVT: Spatio-Temporal Contextual Modeling for robust RGB-T Tracking","code":"https://github.com/laisimiao/MambaVT","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"APTrack","metrics":{"Precision":"90.6","Success":"67.2"},"uses_additional_data":false,"paper_date":"2025-02-10","paper":"/paper/adaptive-perception-for-unified-visual-multi","paper_url":"https://arxiv.org/abs/2502.06583v1","paper_title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":8,"model":"AFter","metrics":{"Precision":"90.1","Success":"66.7"},"uses_additional_data":false,"paper_date":"2024-05-04","paper":"/paper/after-attention-based-fusion-router-for-rgbt","paper_url":"https://arxiv.org/abs/2405.02717v1","paper_title":"AFter: Attention-based Fusion Router for RGBT Tracking","code":"https://github.com/alexadlu/after","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"CKD","metrics":{"Precision":"90.0","Success":"67.4"},"uses_additional_data":false,"paper_date":"2024-10-15","paper":"/paper/breaking-modality-gap-in-rgbt-tracking","paper_url":"https://arxiv.org/abs/2410.11586v1","paper_title":"Breaking Modality Gap in RGBT Tracking: Coupled Knowledge Distillation","code":"https://github.com/multi-modality-tracking/ckd","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"SeqTrackv2-B384","metrics":{"Precision":"90.0","Success":"66.3"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/seqtrack-sequence-to-sequence-learning-for","paper_url":"https://arxiv.org/abs/2304.14394v3","paper_title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","code":"https://github.com/chenxin-dlut/seqtrackv2","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"CFBT","metrics":{"Precision":"89.9","Success":"65.9"},"uses_additional_data":false,"paper_date":"2024-08-30","paper":"/paper/cross-fusion-rgb-t-tracking-with-bi","paper_url":"https://arxiv.org/abs/2408.16979v1","paper_title":"Cross Fusion RGB-T Tracking with Bi-directional Adapter","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"STTrack","metrics":{"Precision":"89.8","Success":"66.7"},"uses_additional_data":false,"paper_date":"2024-12-20","paper":"/paper/exploiting-multimodal-spatial-temporal","paper_url":"https://arxiv.org/abs/2412.15691v1","paper_title":"Exploiting Multimodal Spatial-temporal Patterns for Video Object Tracking","code":"https://github.com/nju-pcalab/sttrack","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"TPF","metrics":{"Precision":"89.7","Success":"67.1"},"uses_additional_data":false,"paper_date":"2025-03-14","paper":"/paper/breaking-shallow-limits-task-driven-pixel","paper_url":"https://arxiv.org/abs/2503.11247v1","paper_title":"Breaking Shallow Limits: Task-Driven Pixel Fusion for Gap-free RGBT Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"AINet-B384","metrics":{"Precision":"89.2","Success":"67.3"},"uses_additional_data":false,"paper_date":"2024-08-16","paper":"/paper/rgbt-tracking-via-all-layer-multimodal","paper_url":"https://arxiv.org/abs/2408.08827v2","paper_title":"RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"MambaVT-S256","metrics":{"Precision":"88.9","Success":"65.8"},"uses_additional_data":false,"paper_date":"2024-08-15","paper":"/paper/mambavt-spatio-temporal-contextual-modeling","paper_url":"https://arxiv.org/abs/2408.07889v1","paper_title":"MambaVT: Spatio-Temporal Contextual Modeling for robust RGB-T Tracking","code":"https://github.com/laisimiao/MambaVT","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"MPLT","metrics":{"Precision":"88.4","Success":"65.7"},"uses_additional_data":false,"paper_date":"2023-08-31","paper":"/paper/rgb-t-tracking-via-multi-modal-mutual-prompt","paper_url":"https://arxiv.org/abs/2308.16386v1","paper_title":"RGB-T Tracking via Multi-Modal Mutual Prompt Learning","code":"https://github.com/husteryoung/mplt","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"CSTNet","metrics":{"Precision":"88.4","Success":"65.2"},"uses_additional_data":false,"paper_date":"2024-05-06","paper":"/paper/transformer-based-rgb-t-tracking-with-channel","paper_url":"https://arxiv.org/abs/2405.03177v2","paper_title":"Transformer-based RGB-T Tracking with Channel and Spatial Feature Fusion","code":"https://github.com/liyunfenglyf/cstnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"CAFormer","metrics":{"Precision":"88.3","Success":"66.4"},"uses_additional_data":false,"paper_date":"2024-08-05","paper":"/paper/2408-02222","paper_url":"https://arxiv.org/abs/2408.02222v1","paper_title":"Cross-modulated Attention Transformer for RGBT Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":19,"model":"MoETrack","metrics":{"Precision":"88.1","Success":"65.1"},"uses_additional_data":false,"paper_date":"2024-04-30","paper":"/paper/revisiting-rgbt-tracking-benchmarks-from-the","paper_url":"https://arxiv.org/abs/2405.00168v1","paper_title":"Revisiting RGBT Tracking Benchmarks from the Perspective of Modality Validity: A New Benchmark, Problem, and Method","code":"https://github.com/zhangyong-tang/moetrack","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"SeqTrackv2-B256","metrics":{"Precision":"88.0","Success":"64.7"},"uses_additional_data":false,"paper_date":"2023-04-27","paper":"/paper/seqtrack-sequence-to-sequence-learning-for","paper_url":"https://arxiv.org/abs/2304.14394v3","paper_title":"Unified Sequence-to-Sequence Learning for Single- and Multi-Modal Visual Object Tracking","code":"https://github.com/chenxin-dlut/seqtrackv2","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"GMMT","metrics":{"Precision":"87.9","Success":"64.7"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/generative-based-fusion-mechanism-for-multi","paper_url":"https://arxiv.org/abs/2309.01728v3","paper_title":"Generative-based Fusion Mechanism for Multi-Modal Tracking","code":"https://github.com/zhangyong-tang/gmmt","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"USTrack","metrics":{"Precision":"87.4","Success":"65.8"},"uses_additional_data":false,"paper_date":"2023-08-26","paper":"/paper/unified-single-stage-transformer-network-for","paper_url":"https://arxiv.org/abs/2308.13764v1","paper_title":"Unified Single-Stage Transformer Network for Efficient RGB-T Tracking","code":"https://github.com/xiajianqiang/USTrack","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"MMMP","metrics":{"Precision":"87.3","Success":"65.1"},"uses_additional_data":false,"paper_date":"2024-03-25","paper":"/paper/from-two-stream-to-one-stream-efficient-rgb-t","paper_url":"https://arxiv.org/abs/2403.16834v2","paper_title":"From Two-Stream to One-Stream: Efficient RGB-T Tracking via Mutual Prompt Learning and Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":24,"model":"TATrack","metrics":{"Precision":"87.2","Success":"64.4"},"uses_additional_data":false,"paper_date":"2024-01-02","paper":"/paper/temporal-adaptive-rgbt-tracking-with-modality","paper_url":"https://arxiv.org/abs/2401.01244v1","paper_title":"Temporal Adaptive RGBT Tracking with Modality Prompt","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":25,"model":"TBSI","metrics":{"Precision":"87.1","Success":"63.7"},"uses_additional_data":false,"paper_date":"2023-01-01","paper":"/paper/bridging-search-region-interaction-with","paper_url":"http://openaccess.thecvf.com//content/CVPR2023/html/Hui_Bridging_Search_Region_Interaction_With_Template_for_RGB-T_Tracking_CVPR_2023_paper.html","paper_title":"Bridging Search Region Interaction With Template for RGB-T Tracking","code":"https://github.com/ryanhtr/tbsi","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"BAT","metrics":{"Precision":"86.8","Success":"64.1"},"uses_additional_data":false,"paper_date":"2023-12-17","paper":"/paper/bi-directional-adapter-for-multi-modal","paper_url":"https://arxiv.org/abs/2312.10611v1","paper_title":"Bi-directional Adapter for Multi-modal Tracking","code":"https://github.com/sparktempest/bat","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"STMT","metrics":{"Precision":"86.5","Success":"63.8"},"uses_additional_data":false,"paper_date":"2024-01-03","paper":"/paper/transformer-rgbt-tracking-with-spatio","paper_url":"https://arxiv.org/abs/2401.01674v1","paper_title":"Transformer RGBT Tracking with Spatio-Temporal Multimodal Tokens","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"M3PT","metrics":{"Precision":"85.9","Success":"63.4"},"uses_additional_data":false,"paper_date":"2024-03-27","paper":"/paper/middle-fusion-and-multi-stage-multi-form","paper_url":"https://arxiv.org/abs/2403.18193v2","paper_title":"Middle Fusion and Multi-Stage, Multi-Form Prompts for Robust RGB-T Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"OneTracker","metrics":{"Precision":"85.7","Success":"64.2"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/onetracker-unifying-visual-object-tracking","paper_url":"https://arxiv.org/abs/2403.09634v1","paper_title":"OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient Tuning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"SDSTrack","metrics":{"Precision":"84.8","Success":"62.5"},"uses_additional_data":false,"paper_date":"2024-03-24","paper":"/paper/sdstrack-self-distillation-symmetric-adapter","paper_url":"https://arxiv.org/abs/2403.16002v2","paper_title":"SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking","code":"https://github.com/hoqolo/sdstrack","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"Un-Track","metrics":{"Precision":"84.2","Success":"62.5"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/single-model-and-any-modality-for-video","paper_url":"https://arxiv.org/abs/2311.15851v3","paper_title":"Single-Model and Any-Modality for Video Object Tracking","code":"https://github.com/zongwei97/untrack","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"DMCNet","metrics":{"Precision":"83.9","Success":"59.3"},"uses_additional_data":false,"paper_date":"2020-11-14","paper":"/paper/duality-gated-mutual-condition-network-for","paper_url":"https://arxiv.org/abs/2011.07188v3","paper_title":"Duality-Gated Mutual Condition Network for RGBT Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"ViPT","metrics":{"Precision":"83.5","Success":"61.7"},"uses_additional_data":false,"paper_date":"2023-03-20","paper":"/paper/visual-prompt-multi-modal-tracking","paper_url":"https://arxiv.org/abs/2303.10826v2","paper_title":"Visual Prompt Multi-Modal Tracking","code":"https://github.com/jiawen-zhu/vipt","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"APFNet","metrics":{"Precision":"82.7","Success":"57.9"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/attribute-based-progressive-fusion-network","paper_url":"https://ojs.aaai.org/index.php/AAAI/article/view/20187","paper_title":"Attribute-Based Progressive Fusion Network for RGBT Tracking","code":"https://github.com/yangmengmeng1997/APFNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":35,"model":"CMD","metrics":{"Precision":"82.4","Success":"58.4"},"uses_additional_data":false,"paper_date":"2023-01-01","paper":"/paper/efficient-rgb-t-tracking-via-cross-modality","paper_url":"http://openaccess.thecvf.com//content/CVPR2023/html/Zhang_Efficient_RGB-T_Tracking_via_Cross-Modality_Distillation_CVPR_2023_paper.html","paper_title":"Efficient RGB-T Tracking via Cross-Modality Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"CMPP","metrics":{"Precision":"82.3","Success":"57.5"},"uses_additional_data":false,"paper_date":"2020-06-01","paper":"/paper/cross-modal-pattern-propagation-for-rgb-t","paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Wang_Cross-Modal_Pattern-Propagation_for_RGB-T_Tracking_CVPR_2020_paper.html","paper_title":"Cross-Modal Pattern-Propagation for RGB-T Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":37,"model":"MANet++","metrics":{"Precision":"80.0","Success":"55.4"},"uses_additional_data":false,"paper_date":"2020-11-14","paper":"/paper/rgbt-tracking-via-multi-adapter-network-with","paper_url":"https://arxiv.org/abs/2011.07189v3","paper_title":"RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":38,"model":"JMMAC","metrics":{"Precision":"79.0","Success":"57.3"},"uses_additional_data":false,"paper_date":"2020-07-04","paper":"/paper/jointly-modeling-motion-and-appearance-cues","paper_url":"https://arxiv.org/abs/2007.02041v1","paper_title":"Jointly Modeling Motion and Appearance Cues for Robust RGB-T Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":39,"model":"HMFT","metrics":{"Precision":"78.8","Success":"56.8"},"uses_additional_data":false,"paper_date":"2022-04-08","paper":"/paper/visible-thermal-uav-tracking-a-large-scale","paper_url":"https://arxiv.org/abs/2204.04120v1","paper_title":"Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline","code":"https://github.com/zhang-pengyu/HMFT","n_code_links":1,"syntology":null},{"rank_in_archive_order":40,"model":"ProTrack","metrics":{"Precision":"78.6","Success":"58.7"},"uses_additional_data":false,"paper_date":"2022-07-29","paper":"/paper/prompting-for-multi-modal-tracking","paper_url":"https://arxiv.org/abs/2207.14571v2","paper_title":"Prompting for Multi-Modal Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":41,"model":"DFNet","metrics":{"Precision":"78.6","Success":"58.7"},"uses_additional_data":false,"paper_date":"2021-09-16","paper":"/paper/dynamic-fusion-network-for-rgbt-tracking","paper_url":"https://arxiv.org/abs/2109.07662v1","paper_title":"Dynamic Fusion Network for RGBT Tracking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":42,"model":"MFGNet","metrics":{"Precision":"77.2","Success":"51.3"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/mfgnet-dynamic-modality-aware-filter","paper_url":"https://arxiv.org/abs/2107.10433v2","paper_title":"MFGNet: Dynamic Modality-Aware Filter Generation for RGB-T Tracking","code":"https://github.com/wangxiao5791509/MFG_RGBT_Tracking_PyTorch","n_code_links":2,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":3,"rows_with_any_sample_ran":3,"distinct_papers_with_graph_line":3,"distinct_papers_with_any_sample_ran":3,"samples_over_distinct_papers":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}