{"url":"/sota/temporal-action-localization-on-thumos14","task":{"name":"Temporal Action Localization","url":"/task/action-recognition","note":null},"dataset":{"name":"THUMOS’14","url":"/dataset/thumos14-1"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"Temporal Action Localization aims to detect activities in the video stream and  output beginning and end timestamps. It is closely related to  Temporal Action Proposal Generation.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Avg mAP (0.3:0.7)","mAP IOU@0.1","mAP IOU@0.2","mAP IOU@0.3","mAP IOU@0.4","mAP IOU@0.5","mAP IOU@0.6","mAP IOU@0.7"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Avg mAP (0.3:0.7)":"higher","mAP IOU@0.1":"higher","mAP IOU@0.2":"higher","mAP IOU@0.3":"higher","mAP IOU@0.4":"higher","mAP IOU@0.5":"higher","mAP IOU@0.6":"higher","mAP IOU@0.7":"higher"}},"counts":{"rows":42,"rows_with_code":36,"rows_with_paper_page":42,"rows_dated":42,"rows_using_additional_data":6},"rows":[{"rank_in_archive_order":1,"model":"AdaTAD (VideoMAEv2-giant)","metrics":{"Avg mAP (0.3:0.7)":"76.9","mAP IOU@0.3":"89.7","mAP IOU@0.4":"86.7","mAP IOU@0.5":"80.9","mAP IOU@0.6":"71.0","mAP IOU@0.7":"56.1"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/end-to-end-temporal-action-detection-with-1b","paper_url":"https://arxiv.org/abs/2311.17241v2","paper_title":"End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames","code":"https://github.com/sming256/OpenTAD","n_code_links":2,"syntology":null},{"rank_in_archive_order":2,"model":"RDFA-S6 (InternVideo2-6B)","metrics":{"Avg mAP (0.3:0.7)":"74.2","mAP IOU@0.3":"88.7","mAP IOU@0.4":"84.6","mAP IOU@0.5":"78.2","mAP IOU@0.6":"66.6","mAP IOU@0.7":"51.9"},"uses_additional_data":false,"paper_date":"2024-07-18","paper":"/paper/enhancing-temporal-action-localization","paper_url":"https://arxiv.org/abs/2407.13078v1","paper_title":"Enhancing Temporal Action Localization: Advanced S6 Modeling with Recurrent Mechanism","code":"https://github.com/lsy0882/RDFA-S6","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"ActionMamba(InternVideo2-6B)","metrics":{"Avg mAP (0.3:0.7)":"72.72","mAP IOU@0.3":"86.89","mAP IOU@0.4":"83.09","mAP IOU@0.5":"76.90","mAP IOU@0.6":"65.91","mAP IOU@0.7":"50.82"},"uses_additional_data":false,"paper_date":"2024-03-14","paper":"/paper/video-mamba-suite-state-space-model-as-a","paper_url":"https://arxiv.org/abs/2403.09626v1","paper_title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","code":"https://github.com/opengvlab/video-mamba-suite","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"InternVideo2-6B","metrics":{"Avg mAP (0.3:0.7)":"72.0"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"ActionFormer (InternVideo features)","metrics":{"Avg mAP (0.3:0.7)":"71.58"},"uses_additional_data":true,"paper_date":"2022-12-06","paper":"/paper/internvideo-general-video-foundation-models","paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"TriDet (VideoMAE v2-g feature)","metrics":{"Avg mAP (0.3:0.7)":"70.1","mAP IOU@0.3":"84.8","mAP IOU@0.4":"80.0","mAP IOU@0.5":"73.3","mAP IOU@0.6":"63.8","mAP IOU@0.7":"48.8"},"uses_additional_data":true,"paper_date":"2023-09-11","paper":"/paper/temporal-action-localization-with-enhanced","paper_url":"https://arxiv.org/abs/2309.05590v1","paper_title":"Temporal Action Localization with Enhanced Instant Discriminability","code":"https://github.com/dingfengshi/tridet","n_code_links":3,"syntology":null},{"rank_in_archive_order":7,"model":"InternVideo2-1B","metrics":{"Avg mAP (0.3:0.7)":"69.8"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"ActionFormer (VideoMAE V2-g features)","metrics":{"Avg mAP (0.3:0.7)":"69.6","mAP IOU@0.3":"84.0","mAP IOU@0.4":"79.6","mAP IOU@0.5":"73.0","mAP IOU@0.6":"63.5","mAP IOU@0.7":"47.7"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"TriDet (I3D features)","metrics":{"Avg mAP (0.3:0.7)":"69.3","mAP IOU@0.3":"83.6","mAP IOU@0.4":"80.1","mAP IOU@0.5":"72.9","mAP IOU@0.6":"62.4","mAP IOU@0.7":"47.4"},"uses_additional_data":false,"paper_date":"2023-03-13","paper":"/paper/tridet-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2303.07347v2","paper_title":"TriDet: Temporal Action Detection with Relative Boundary Modeling","code":"https://github.com/dingfengshi/tridet","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":10,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ASL(I3D features)","metrics":{"Avg mAP (0.3:0.7)":"67.9","mAP IOU@0.3":"83.1","mAP IOU@0.4":"79.0","mAP IOU@0.5":"71.7","mAP IOU@0.6":"59.7","mAP IOU@0.7":"45.8"},"uses_additional_data":false,"paper_date":"2023-05-25","paper":"/paper/action-sensitivity-learning-for-temporal","paper_url":"https://arxiv.org/abs/2305.15701v2","paper_title":"Action Sensitivity Learning for Temporal Action Localization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":11,"model":"TemporalMaxer (I3D features)","metrics":{"Avg mAP (0.3:0.7)":"67.7","mAP IOU@0.3":"82.8","mAP IOU@0.4":"78.9","mAP IOU@0.5":"71.8","mAP IOU@0.6":"60.5","mAP IOU@0.7":"44.7"},"uses_additional_data":false,"paper_date":"2023-03-16","paper":"/paper/temporalmaxer-maximize-temporal-context-with","paper_url":"https://arxiv.org/abs/2303.09055v1","paper_title":"TemporalMaxer: Maximize Temporal Context with only Max Pooling for Temporal Action Localization","code":"https://github.com/tuantng/temporalmaxer","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"DualDETR (I3D features)","metrics":{"Avg mAP (0.3:0.7)":"66.8","mAP IOU@0.3":"82.9","mAP IOU@0.4":"78.0","mAP IOU@0.5":"70.4","mAP IOU@0.6":"58.5","mAP IOU@0.7":"44.4"},"uses_additional_data":false,"paper_date":"2024-03-31","paper":"/paper/dual-detrs-for-multi-label-temporal-action","paper_url":"https://arxiv.org/abs/2404.00653v1","paper_title":"Dual DETRs for Multi-Label Temporal Action Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"ActionFormer (I3D features)","metrics":{"Avg mAP (0.3:0.7)":"66.8","mAP IOU@0.3":"82.1","mAP IOU@0.4":"77.8","mAP IOU@0.5":"71.0","mAP IOU@0.6":"59.4","mAP IOU@0.7":"43.9"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/actionformer-localizing-moments-of-actions","paper_url":"https://arxiv.org/abs/2202.07925v2","paper_title":"ActionFormer: Localizing Moments of Actions with Transformers","code":"https://github.com/happyharrycn/actionformer_release","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"TadML(two-stream)","metrics":{"Avg mAP (0.3:0.7)":"59.70","mAP IOU@0.3":"73.29","mAP IOU@0.4":"69.73","mAP IOU@0.5":"62.53","mAP IOU@0.6":"53.36","mAP IOU@0.7":"39.60"},"uses_additional_data":false,"paper_date":"2022-06-07","paper":"/paper/tadml-a-fast-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2206.02997v2","paper_title":"TadML: A fast temporal action detection with Mechanics-MLP","code":"https://github.com/boneddeng/tadml","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"BasicTAD  (160,6,192,R50-SlowOnly)","metrics":{"Avg mAP (0.3:0.7)":"59.6","mAP IOU@0.3":"75.5","mAP IOU@0.4":"70.8","mAP IOU@0.5":"63.5","mAP IOU@0.6":"50.9","mAP IOU@0.7":"37.4"},"uses_additional_data":false,"paper_date":"2022-05-05","paper":"/paper/basictad-an-astounding-rgb-only-baseline-for","paper_url":"https://arxiv.org/abs/2205.02717v3","paper_title":"BasicTAD: an Astounding RGB-Only Baseline for Temporal Action Detection","code":"https://github.com/mcg-nju/basictad","n_code_links":2,"syntology":null},{"rank_in_archive_order":16,"model":"TadTR","metrics":{"Avg mAP (0.3:0.7)":"56.7","mAP IOU@0.3":"74.8","mAP IOU@0.4":"69.1","mAP IOU@0.5":"60.1","mAP IOU@0.6":"46.6","mAP IOU@0.7":"32.8"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/end-to-end-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2106.10271v4","paper_title":"End-to-end Temporal Action Detection with Transformer","code":"https://github.com/xlliu7/TadTR","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"ReAct (TSN features)","metrics":{"Avg mAP (0.3:0.7)":"55.0","mAP IOU@0.3":"69.2","mAP IOU@0.4":"65.0","mAP IOU@0.5":"57.1","mAP IOU@0.6":"47.8","mAP IOU@0.7":"35.6"},"uses_additional_data":false,"paper_date":"2022-07-14","paper":"/paper/react-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2207.07097v1","paper_title":"ReAct: Temporal Action Detection with Relational Queries","code":"https://github.com/sssste/react","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":10,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"BasicTAD  (112,3,96,R50-SlowOnly)","metrics":{"Avg mAP (0.3:0.7)":"54.9","mAP IOU@0.3":"68.4","mAP IOU@0.4":"65.0","mAP IOU@0.5":"58.6","mAP IOU@0.6":"49.2","mAP IOU@0.7":"33.5"},"uses_additional_data":false,"paper_date":"2022-05-05","paper":"/paper/basictad-an-astounding-rgb-only-baseline-for","paper_url":"https://arxiv.org/abs/2205.02717v3","paper_title":"BasicTAD: an Astounding RGB-Only Baseline for Temporal Action Detection","code":"https://github.com/mcg-nju/basictad","n_code_links":2,"syntology":null},{"rank_in_archive_order":19,"model":"E2E-TAD (SlowFast R50+TadTR)","metrics":{"Avg mAP (0.3:0.7)":"54.2","mAP IOU@0.3":"69.4","mAP IOU@0.4":"64.3","mAP IOU@0.5":"56.0","mAP IOU@0.6":"46.4","mAP IOU@0.7":"34.9"},"uses_additional_data":false,"paper_date":"2022-04-06","paper":"/paper/an-empirical-study-of-end-to-end-temporal","paper_url":"https://arxiv.org/abs/2204.02932v1","paper_title":"An Empirical Study of End-to-End Temporal Action Detection","code":"https://github.com/xlliu7/E2E-TAD","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":11}},{"rank_in_archive_order":20,"model":"TadML(rgb-only)","metrics":{"Avg mAP (0.3:0.7)":"53.46","mAP IOU@0.3":"68.78","mAP IOU@0.4":"64.66","mAP IOU@0.5":"56.61","mAP IOU@0.6":"45.40","mAP IOU@0.7":"31.88"},"uses_additional_data":false,"paper_date":"2022-06-07","paper":"/paper/tadml-a-fast-temporal-action-detection-with","paper_url":"https://arxiv.org/abs/2206.02997v2","paper_title":"TadML: A fast temporal action detection with Mechanics-MLP","code":"https://github.com/boneddeng/tadml","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"MUSES","metrics":{"Avg mAP (0.3:0.7)":"53.4","mAP IOU@0.3":"68.9","mAP IOU@0.4":"64.0","mAP IOU@0.5":"56.9","mAP IOU@0.6":"46.3","mAP IOU@0.7":"31.0"},"uses_additional_data":false,"paper_date":"2020-12-17","paper":"/paper/multi-shot-temporal-event-localization-a","paper_url":"https://arxiv.org/abs/2012.09434v2","paper_title":"Multi-shot Temporal Event Localization: a Benchmark","code":"https://github.com/xlliu7/muses","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"AVFusion","metrics":{"Avg mAP (0.3:0.7)":"53.3","mAP IOU@0.3":"70.1","mAP IOU@0.4":"64.9","mAP IOU@0.5":"57.1","mAP IOU@0.6":"45.4","mAP IOU@0.7":"28.8"},"uses_additional_data":true,"paper_date":"2021-06-27","paper":"/paper/hear-me-out-fusional-approaches-for-audio","paper_url":"https://arxiv.org/abs/2106.14118v4","paper_title":"Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","code":"https://github.com/skelemoa/tal-hmo","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"TAGS (I3D)","metrics":{"Avg mAP (0.3:0.7)":"52.8","mAP IOU@0.3":"68.6","mAP IOU@0.4":"63.8","mAP IOU@0.5":"57.0","mAP IOU@0.6":"46.3","mAP IOU@0.7":"31.8"},"uses_additional_data":false,"paper_date":"2022-07-14","paper":"/paper/temporal-action-detection-with-global","paper_url":"https://arxiv.org/abs/2207.06580v2","paper_title":"Proposal-Free Temporal Action Detection via Global Segmentation Mask Learning","code":"https://github.com/sauradip/stale","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":24,"model":"DCAN (TSN features)","metrics":{"Avg mAP (0.3:0.7)":"52.3","mAP IOU@0.3":"68.2","mAP IOU@0.4":"62.7","mAP IOU@0.5":"54.1","mAP IOU@0.6":"43.9","mAP IOU@0.7":"32.6"},"uses_additional_data":false,"paper_date":"2021-12-07","paper":"/paper/dcan-improving-temporal-action-detection-via","paper_url":"https://arxiv.org/abs/2112.03612v1","paper_title":"DCAN: Improving Temporal Action Detection via Dual Context Aggregation","code":"https://github.com/cg1177/dcan","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"TSP","metrics":{"Avg mAP (0.3:0.7)":"50.46","mAP IOU@0.1":"74.02","mAP IOU@0.2":"72.29","mAP IOU@0.3":"69.1","mAP IOU@0.4":"63.3","mAP IOU@0.5":"53.5","mAP IOU@0.6":"40.4","mAP IOU@0.7":"26"},"uses_additional_data":false,"paper_date":"2020-11-23","paper":"/paper/tsp-temporally-sensitive-pretraining-of-video","paper_url":"https://arxiv.org/abs/2011.11479v3","paper_title":"TSP: Temporally-Sensitive Pretraining of Video Encoders for Localization Tasks","code":"https://github.com/HumamAlwassel/TSP","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"VSGN","metrics":{"Avg mAP (0.3:0.7)":"50.2","mAP IOU@0.3":"66.7","mAP IOU@0.4":"60.4","mAP IOU@0.5":"52.4","mAP IOU@0.6":"41.0","mAP IOU@0.7":"30.4"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/video-self-stitching-graph-network-for","paper_url":"https://arxiv.org/abs/2011.14598v4","paper_title":"Video Self-Stitching Graph Network for Temporal Action Localization","code":"https://github.com/coolbay/VSGN","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":27,"model":"DaoTAD","metrics":{"Avg mAP (0.3:0.7)":"50.0","mAP IOU@0.3":"62.8","mAP IOU@0.4":"59.5","mAP IOU@0.5":"53.8","mAP IOU@0.6":"43.6","mAP IOU@0.7":"30.1"},"uses_additional_data":false,"paper_date":"2021-07-09","paper":"/paper/rgb-stream-is-enough-for-temporal-action","paper_url":"https://arxiv.org/abs/2107.04362v1","paper_title":"RGB Stream Is Enough for Temporal Action Detection","code":"https://github.com/Media-Smart/vedatad","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"Decouple-SSAD","metrics":{"Avg mAP (0.3:0.7)":"42.0","mAP IOU@0.3":"60.2","mAP IOU@0.4":"54.1","mAP IOU@0.5":"44.2","mAP IOU@0.6":"32.3","mAP IOU@0.7":"19.1"},"uses_additional_data":false,"paper_date":"2019-04-16","paper":"/paper/decoupling-localization-and-classification-in","paper_url":"http://arxiv.org/abs/1904.07442v1","paper_title":"Decoupling Localization and Classification in Single Shot Temporal Action Detection","code":"https://github.com/hypjudy/Decouple-SSAD","n_code_links":1,"syntology":null},{"rank_in_archive_order":29,"model":"TAL-Net","metrics":{"Avg mAP (0.3:0.7)":"39.8","mAP IOU@0.1":"59.8","mAP IOU@0.2":"57.1","mAP IOU@0.3":"53.2","mAP IOU@0.4":"48.5","mAP IOU@0.5":" 42.8","mAP IOU@0.6":"33.8","mAP IOU@0.7":"20.8"},"uses_additional_data":false,"paper_date":"2018-04-20","paper":"/paper/rethinking-the-faster-r-cnn-architecture-for","paper_url":"http://arxiv.org/abs/1804.07667v1","paper_title":"Rethinking the Faster R-CNN Architecture for Temporal Action Localization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"GCM","metrics":{"mAP IOU@0.1":"72.5","mAP IOU@0.2":"70.9","mAP IOU@0.3":"66.5","mAP IOU@0.4":"60.8","mAP IOU@0.5":"51.9"},"uses_additional_data":false,"paper_date":"2021-12-01","paper":"/paper/graph-convolutional-module-for-temporal","paper_url":"https://arxiv.org/abs/2112.00302v1","paper_title":"Graph Convolutional Module for Temporal Action Localization in Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":31,"model":"AGT (Ours)","metrics":{"mAP IOU@0.1":"72.1","mAP IOU@0.2":"69.8","mAP IOU@0.3":"65","mAP IOU@0.4":"58.1","mAP IOU@0.5":"50.2"},"uses_additional_data":false,"paper_date":"2021-01-21","paper":"/paper/activity-graph-transformer-for-temporal","paper_url":"https://arxiv.org/abs/2101.08540v2","paper_title":"Activity Graph Transformer for Temporal Action Localization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":32,"model":"P-GCN","metrics":{"mAP IOU@0.1":"69.5","mAP IOU@0.2":"67.8","mAP IOU@0.3":"63.6","mAP IOU@0.4":"57.8","mAP IOU@0.5":"49.1"},"uses_additional_data":false,"paper_date":"2019-09-07","paper":"/paper/graph-convolutional-networks-for-temporal","paper_url":"https://arxiv.org/abs/1909.03252v1","paper_title":"Graph Convolutional Networks for Temporal Action Localization","code":"https://github.com/Alvin-Zeng/PGCN","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"DeepMetricLearner","metrics":{"mAP IOU@0.1":"62.3","mAP IOU@0.3":"46.8","mAP IOU@0.5":"29.6","mAP IOU@0.7":"9.7"},"uses_additional_data":false,"paper_date":"2020-01-21","paper":"/paper/weakly-supervised-temporal-action-1","paper_url":"https://arxiv.org/abs/2001.07793v1","paper_title":"Weakly Supervised Temporal Action Localization Using Deep Metric Learning","code":"https://github.com/asrafulashiq/wsad","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"CBR-TS","metrics":{"mAP IOU@0.1":"60.1","mAP IOU@0.2":"56.7","mAP IOU@0.3":"50.1","mAP IOU@0.4":"41.3","mAP IOU@0.5":"31","mAP IOU@0.6":"19.1","mAP IOU@0.7":"9.9"},"uses_additional_data":false,"paper_date":"2017-05-02","paper":"/paper/cascaded-boundary-regression-for-temporal","paper_url":"http://arxiv.org/abs/1705.01180v1","paper_title":"Cascaded Boundary Regression for Temporal Action Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":35,"model":"R-C3D","metrics":{"mAP IOU@0.1":"54.5","mAP IOU@0.2":"51.5","mAP IOU@0.3":"44.8","mAP IOU@0.4":"35.6","mAP IOU@0.5":"28.9"},"uses_additional_data":false,"paper_date":"2017-03-22","paper":"/paper/r-c3d-region-convolutional-3d-network-for","paper_url":"http://arxiv.org/abs/1703.07814v2","paper_title":"R-C3D: Region Convolutional 3D Network for Temporal Activity Detection","code":"https://github.com/VisionLearningGroup/R-C3D","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"TURN-FL-16 + S-CNN","metrics":{"mAP IOU@0.1":"54","mAP IOU@0.2":"50.9","mAP IOU@0.3":"44.1","mAP IOU@0.4":"34.9","mAP IOU@0.5":"25.6"},"uses_additional_data":false,"paper_date":"2017-03-17","paper":"/paper/turn-tap-temporal-unit-regression-network-for","paper_url":"http://arxiv.org/abs/1703.06189v2","paper_title":"TURN TAP: Temporal Unit Regression Network for Temporal Action Proposals","code":"https://github.com/jiyanggao/TURN-TAP","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"Yeung et al.","metrics":{"mAP IOU@0.1":"48.9","mAP IOU@0.2":"44.0","mAP IOU@0.3":"36.0","mAP IOU@0.4":"26.4","mAP IOU@0.5":"17.1"},"uses_additional_data":false,"paper_date":"2015-11-22","paper":"/paper/end-to-end-learning-of-action-detection-from","paper_url":"http://arxiv.org/abs/1511.06984v2","paper_title":"End-to-end Learning of Action Detection from Frame Glimpses in Videos","code":"https://github.com/syyeung/frameglimpses","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"S-CNN","metrics":{"mAP IOU@0.1":"47.7","mAP IOU@0.2":"43.5","mAP IOU@0.3":"36.3","mAP IOU@0.4":"28.7","mAP IOU@0.5":"19"},"uses_additional_data":false,"paper_date":"2016-01-09","paper":"/paper/temporal-action-localization-in-untrimmed","paper_url":"http://arxiv.org/abs/1601.02129v2","paper_title":"Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs","code":"https://github.com/zhengshou/scnn","n_code_links":1,"syntology":null},{"rank_in_archive_order":39,"model":"BSN UNet","metrics":{"mAP IOU@0.3":"53.5","mAP IOU@0.4":"45","mAP IOU@0.5":"36.9","mAP IOU@0.6":"28.4","mAP IOU@0.7":"20"},"uses_additional_data":false,"paper_date":"2018-06-08","paper":"/paper/bsn-boundary-sensitive-network-for-temporal","paper_url":"http://arxiv.org/abs/1806.02964v3","paper_title":"BSN: Boundary Sensitive Network for Temporal Action Proposal Generation","code":"https://github.com/PaddlePaddle/models/tree/develop/PaddleCV/video/models/bsn","n_code_links":17,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":40,"model":"CDC","metrics":{"mAP IOU@0.3":"40.1","mAP IOU@0.4":"29.4","mAP IOU@0.5":"23.3","mAP IOU@0.6":"13.1","mAP IOU@0.7":"7.9"},"uses_additional_data":false,"paper_date":"2017-03-04","paper":"/paper/cdc-convolutional-de-convolutional-networks","paper_url":"http://arxiv.org/abs/1703.01515v2","paper_title":"CDC: Convolutional-De-Convolutional Networks for Precise Temporal Action Localization in Untrimmed Videos","code":"https://bitbucket.org/columbiadvmm/cdc","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"G-TAD","metrics":{"mAP IOU@0.5":"40.2"},"uses_additional_data":false,"paper_date":"2019-11-26","paper":"/paper/g-tad-sub-graph-localization-for-temporal","paper_url":"https://arxiv.org/abs/1911.11462v2","paper_title":"G-TAD: Sub-Graph Localization for Temporal Action Detection","code":"https://github.com/Frostinassiky/gtad","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":15,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"BMN","metrics":{"mAP IOU@0.5":"32.2"},"uses_additional_data":false,"paper_date":"2019-07-23","paper":"/paper/bmn-boundary-matching-network-for-temporal","paper_url":"https://arxiv.org/abs/1907.09702v1","paper_title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","code":"https://github.com/PaddlePaddle/models/tree/develop/PaddleCV/video/models/bmn","n_code_links":15,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":13,"rows_with_any_sample_ran":12,"distinct_papers_with_graph_line":13,"distinct_papers_with_any_sample_ran":12,"samples_over_distinct_papers":{"n_ran":35,"n_unverified":66,"n_samples":101,"n_pointer_only_licence":19,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":35,"n_unverified":66,"n_samples":101,"n_pointer_only_licence":19,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}