{"url":"/sota/temporal-action-localization-on-activitynet","task":{"name":"Temporal Action Localization","url":"/task/action-recognition","note":null},"dataset":{"name":"ActivityNet-1.3","url":"/dataset/activitynet"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"Temporal Action Localization aims to detect activities in the video stream and  output beginning and end timestamps. It is closely related to  Temporal Action Proposal Generation.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["mAP","mAP IOU@0.5","mAP IOU@0.75","mAP IOU@0.95"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"mAP":"higher","mAP IOU@0.5":"higher","mAP IOU@0.75":"higher","mAP IOU@0.95":"higher"}},"counts":{"rows":33,"rows_with_code":29,"rows_with_paper_page":33,"rows_dated":33,"rows_using_additional_data":3},"rows":[{"rank_in_archive_order":1,"model":"RDFA-S6 (InternVideo2-6B)","metrics":{"mAP":"42.9","mAP IOU@0.5":"64.1","mAP IOU@0.75":"44.0","mAP IOU@0.95":"10.6"},"uses_additional_data":false,"paper_date":"2024-07-18","paper":"/paper/enhancing-temporal-action-localization","paper_url":"https://arxiv.org/abs/2407.13078v1","paper_title":"Enhancing Temporal Action Localization: Advanced S6 Modeling with Recurrent Mechanism","code":"https://github.com/lsy0882/RDFA-S6","n_code_links":1,"syntology":null},{"rank_in_archive_order":2,"model":"ActionMamba (InternVideo2-6B)","metrics":{"mAP":"42.02","mAP IOU@0.5":"62.43","mAP IOU@0.75":"43.49","mAP IOU@0.95":"10.23"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/video-mamba-suite-state-space-model-as-a","paper_url":"https://arxiv.org/abs/2403.09626v1","paper_title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","code":"https://github.com/opengvlab/video-mamba-suite","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"PRN+BMN (ensemble)","metrics":{"mAP":"42.0","mAP IOU@0.5":"59.7"},"uses_additional_data":true,"paper_date":"2021-06-20","paper":"/paper/proposal-relation-network-for-temporal-action","paper_url":"https://arxiv.org/abs/2106.11812v1","paper_title":"Proposal Relation Network for Temporal Action Detection","code":"https://github.com/wangxiang1230/SSTAP","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"AdaTAD (VideoMAEv2-giant)","metrics":{"mAP":"41.93","mAP IOU@0.5":"61.72","mAP IOU@0.75":"43.35","mAP IOU@0.95":"10.85"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/end-to-end-temporal-action-detection-with-1b","paper_url":"https://arxiv.org/abs/2311.17241v2","paper_title":"End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames","code":"https://github.com/sming256/OpenTAD","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"InternVideo2-6B","metrics":{"mAP":"41.2"},"uses_additional_data":false,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":6,"model":"InternVideo2-1B","metrics":{"mAP":"40.4"},"uses_additional_data":false,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":7,"model":"UniMD+Sync.","metrics":{"mAP":"39.83","mAP IOU@0.5":"60.29"},"uses_additional_data":false,"paper_date":"2024-04-07","paper":"/paper/unimd-towards-unifying-moment-retrieval-and","paper_url":"https://arxiv.org/abs/2404.04933v2","paper_title":"UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection","code":"https://github.com/yingsen1/unimd","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"PRN (CSN)","metrics":{"mAP":"39.4","mAP IOU@0.5":"57.9"},"uses_additional_data":true,"paper_date":"2021-06-20","paper":"/paper/proposal-relation-network-for-temporal-action","paper_url":"https://arxiv.org/abs/2106.11812v1","paper_title":"Proposal Relation Network for Temporal Action Detection","code":"https://github.com/wangxiang1230/SSTAP","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"InternVideo","metrics":{"mAP":"39.00"},"uses_additional_data":true,"paper_date":"2022-12-06","paper":"/paper/internvideo-general-video-foundation-models","paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"TCANet (SlowFast R101)","metrics":{"mAP":"37.56","mAP IOU@0.5":"54.33","mAP IOU@0.75":"39.13","mAP IOU@0.95":"8.41"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/temporal-context-aggregation-network-for","paper_url":"https://arxiv.org/abs/2103.13141v1","paper_title":"Temporal Context Aggregation Network for Temporal Action Proposal Refinement","code":"https://github.com/qingzhiwu/Temporal-Context-Aggregation-Network-Pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":11,"model":"PRN (ViViT)","metrics":{"mAP":"37.5","mAP IOU@0.5":"55.5"},"uses_additional_data":false,"paper_date":"2021-06-20","paper":"/paper/proposal-relation-network-for-temporal-action","paper_url":"https://arxiv.org/abs/2106.11812v1","paper_title":"Proposal Relation Network for Temporal Action Detection","code":"https://github.com/wangxiang1230/SSTAP","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"AVFusion","metrics":{"mAP":"36.82","mAP IOU@0.5":"54.34","mAP IOU@0.75":"37.66","mAP IOU@0.95":"8.93"},"uses_additional_data":false,"paper_date":"2021-06-27","paper":"/paper/hear-me-out-fusional-approaches-for-audio","paper_url":"https://arxiv.org/abs/2106.14118v4","paper_title":"Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","code":"https://github.com/skelemoa/tal-hmo","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"TriDet (TSP features)","metrics":{"mAP":"36.8","mAP IOU@0.5":"54.7","mAP IOU@0.75":"38.0","mAP IOU@0.95":"8.4"},"uses_additional_data":false,"paper_date":"2023-03-13","paper":"/paper/tridet-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2303.07347v2","paper_title":"TriDet: Temporal Action Detection with Relative Boundary Modeling","code":"https://github.com/dingfengshi/tridet","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":10,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"TadTR (TSP features)","metrics":{"mAP":"36.75","mAP IOU@0.5":"53.62","mAP IOU@0.75":"37.52","mAP IOU@0.95":"10.56"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/end-to-end-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2106.10271v4","paper_title":"End-to-end Temporal Action Detection with Transformer","code":"https://github.com/xlliu7/TadTR","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"ActionFormer (TSP feautures)","metrics":{"mAP":"36.6","mAP IOU@0.5":"54.7","mAP IOU@0.75":"37.8","mAP IOU@0.95":"8.4"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/actionformer-localizing-moments-of-actions","paper_url":"https://arxiv.org/abs/2202.07925v2","paper_title":"ActionFormer: Localizing Moments of Actions with Transformers","code":"https://github.com/happyharrycn/actionformer_release","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"TAGS (I3D)","metrics":{"mAP":"36.5"},"uses_additional_data":false,"paper_date":"2022-07-14","paper":"/paper/temporal-action-detection-with-global","paper_url":"https://arxiv.org/abs/2207.06580v2","paper_title":"Proposal-Free Temporal Action Detection via Global Segmentation Mask Learning","code":"https://github.com/sauradip/stale","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":17,"model":"VSGN (TSP features)","metrics":{"mAP":"35.94","mAP IOU@0.5":"53.26","mAP IOU@0.75":"36.76","mAP IOU@0.95":"8.12"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/video-self-stitching-graph-network-for","paper_url":"https://arxiv.org/abs/2011.14598v4","paper_title":"Video Self-Stitching Graph Network for Temporal Action Localization","code":"https://github.com/coolbay/VSGN","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":18,"model":"TSP","metrics":{"mAP":"35.81","mAP IOU@0.5":"51.26","mAP IOU@0.75":"37.12","mAP IOU@0.95":"9.29"},"uses_additional_data":false,"paper_date":"2020-11-23","paper":"/paper/tsp-temporally-sensitive-pretraining-of-video","paper_url":"https://arxiv.org/abs/2011.11479v3","paper_title":"TSP: Temporally-Sensitive Pretraining of Video Encoders for Localization Tasks","code":"https://github.com/HumamAlwassel/TSP","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"HCN(I3D features)","metrics":{"mAP":"35.61","mAP IOU@0.5":"52.51","mAP IOU@0.75":"36.10","mAP IOU@0.95":"7.12"},"uses_additional_data":false,"paper_date":"2023-04-03","paper":"/paper/improve-temporal-action-proposals-using","paper_url":"https://www.sciencedirect.com/science/article/pii/S0031320323002601","paper_title":"Improve Temporal Action Proposals using Hierarchical Context","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"DCAN (TSN features)","metrics":{"mAP":"35.39","mAP IOU@0.5":"51.78","mAP IOU@0.75":"35.98","mAP IOU@0.95":"9.45"},"uses_additional_data":false,"paper_date":"2021-12-07","paper":"/paper/dcan-improving-temporal-action-detection-via","paper_url":"https://arxiv.org/abs/2112.03612v1","paper_title":"DCAN: Improving Temporal Action Detection via Dual Context Aggregation","code":"https://github.com/cg1177/dcan","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"E2E-TAD (SlowFast R50+TadTR)","metrics":{"mAP":"35.10","mAP IOU@0.5":"50.47","mAP IOU@0.75":"35.99","mAP IOU@0.95":"10.83"},"uses_additional_data":false,"paper_date":"2022-04-06","paper":"/paper/an-empirical-study-of-end-to-end-temporal","paper_url":"https://arxiv.org/abs/2204.02932v1","paper_title":"An Empirical Study of End-to-End Temporal Action Detection","code":"https://github.com/xlliu7/E2E-TAD","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":22,"model":"LoFi+G-TAD","metrics":{"mAP":"34.96","mAP IOU@0.5":"50.91","mAP IOU@0.75":"35.86","mAP IOU@0.95":"8.79"},"uses_additional_data":false,"paper_date":"2021-12-01","paper":"/paper/low-fidelity-video-encoder-optimization-for","paper_url":"http://proceedings.neurips.cc/paper/2021/hash/522a9ae9a99880d39e5daec35375e999-Abstract.html","paper_title":"Low-Fidelity Video Encoder Optimization for Temporal Action Localization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"BSN++","metrics":{"mAP":"34.88","mAP IOU@0.5":"51.27","mAP IOU@0.75":"35.70","mAP IOU@0.95":"8.33"},"uses_additional_data":false,"paper_date":"2020-09-15","paper":"/paper/bsn-complementary-boundary-regressor-with","paper_url":"https://arxiv.org/abs/2009.07641v5","paper_title":"BSN++: Complementary Boundary Regressor with Scale-Balanced Relation Modeling for Temporal Action Proposal Generation","code":"https://github.com/xxcheng0708/BSNPlusPlus-boundary-sensitive-network","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"G-TAD+BSP","metrics":{"mAP":"34.75","mAP IOU@0.5":"50.94","mAP IOU@0.75":"35.61","mAP IOU@0.95":"7.98"},"uses_additional_data":false,"paper_date":"2020-11-21","paper":"/paper/boundary-sensitive-pre-training-for-temporal","paper_url":"https://arxiv.org/abs/2011.10830v3","paper_title":"Boundary-sensitive Pre-training for Temporal Localization in Videos","code":"https://github.com/frostinassiky/bsp","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"SSTAP@100%+","metrics":{"mAP":"34.48","mAP IOU@0.5":"50.72","mAP IOU@0.75":"35.28","mAP IOU@0.95":"7.87"},"uses_additional_data":false,"paper_date":"2021-04-07","paper":"/paper/self-supervised-learning-for-semi-supervised","paper_url":"https://arxiv.org/abs/2104.03214v1","paper_title":"Self-Supervised Learning for Semi-Supervised Temporal Action Proposal","code":"https://github.com/wangxiang1230/SSTAP","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":26,"model":"BC-GNN","metrics":{"mAP":"34.26","mAP IOU@0.5":"50.56","mAP IOU@0.75":"34.75","mAP IOU@0.95":"9.37"},"uses_additional_data":false,"paper_date":"2020-08-04","paper":"/paper/boundary-content-graph-neural-network-for","paper_url":"https://arxiv.org/abs/2008.01432v1","paper_title":"Boundary Content Graph Neural Network for Temporal Action Proposal Generation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"GCM","metrics":{"mAP":"34.24","mAP IOU@0.5":"51.03","mAP IOU@0.75":"35.17","mAP IOU@0.95":"7.44"},"uses_additional_data":false,"paper_date":"2021-12-01","paper":"/paper/graph-convolutional-module-for-temporal","paper_url":"https://arxiv.org/abs/2112.00302v1","paper_title":"Graph Convolutional Module for Temporal Action Localization in Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"G-TAD","metrics":{"mAP":"34.09","mAP IOU@0.5":"50.36","mAP IOU@0.75":"34.60","mAP IOU@0.95":"9.02"},"uses_additional_data":false,"paper_date":"2019-11-26","paper":"/paper/g-tad-sub-graph-localization-for-temporal","paper_url":"https://arxiv.org/abs/1911.11462v2","paper_title":"G-TAD: Sub-Graph Localization for Temporal Action Detection","code":"https://github.com/Frostinassiky/gtad","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":15,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"BMN","metrics":{"mAP":"33.85","mAP IOU@0.5":"50.07","mAP IOU@0.75":"34.78","mAP IOU@0.95":"8.29"},"uses_additional_data":false,"paper_date":"2019-07-23","paper":"/paper/bmn-boundary-matching-network-for-temporal","paper_url":"https://arxiv.org/abs/1907.09702v1","paper_title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","code":"https://github.com/PaddlePaddle/models/tree/develop/PaddleCV/video/models/bmn","n_code_links":15,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"SSN","metrics":{"mAP":"32.26","mAP IOU@0.5":"39.12"},"uses_additional_data":false,"paper_date":"2017-03-08","paper":"/paper/a-pursuit-of-temporal-accuracy-in-general","paper_url":"http://arxiv.org/abs/1703.02716v1","paper_title":"A Pursuit of Temporal Accuracy in General Activity Detection","code":"https://github.com/yjxiong/action-detection","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"P-GCN","metrics":{"mAP":"31.11","mAP IOU@0.5":"48.26","mAP IOU@0.75":"33.16","mAP IOU@0.95":"3.27"},"uses_additional_data":false,"paper_date":"2019-09-07","paper":"/paper/graph-convolutional-networks-for-temporal","paper_url":"https://arxiv.org/abs/1909.03252v1","paper_title":"Graph Convolutional Networks for Temporal Action Localization","code":"https://github.com/Alvin-Zeng/PGCN","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"BSN","metrics":{"mAP":"30.03","mAP IOU@0.5":"46.45","mAP IOU@0.75":"29.96","mAP IOU@0.95":"8.02"},"uses_additional_data":false,"paper_date":"2018-06-08","paper":"/paper/bsn-boundary-sensitive-network-for-temporal","paper_url":"http://arxiv.org/abs/1806.02964v3","paper_title":"BSN: Boundary Sensitive Network for Temporal Action Proposal Generation","code":"https://github.com/PaddlePaddle/models/tree/develop/PaddleCV/video/models/bsn","n_code_links":17,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":33,"model":"UnLoc-L","metrics":{"mAP IOU@0.5":"59.3"},"uses_additional_data":false,"paper_date":"2023-08-21","paper":"/paper/unloc-a-unified-framework-for-video","paper_url":"https://arxiv.org/abs/2308.11062v1","paper_title":"UnLoc: A Unified Framework for Video Localization Tasks","code":"https://github.com/google-research/scenic","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":12,"rows_with_any_sample_ran":10,"distinct_papers_with_graph_line":12,"distinct_papers_with_any_sample_ran":10,"samples_over_distinct_papers":{"n_ran":31,"n_unverified":61,"n_samples":92,"n_pointer_only_licence":20,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":31,"n_unverified":61,"n_samples":92,"n_pointer_only_licence":20,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}