{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/temporal-action-localization-in-untrimmed","title":"Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs","arxiv_id":"1601.02129","date":"2016-01-09","proceeding":"CVPR 2016 6","authors":["Zheng Shou","Dongang Wang","Shih-Fu Chang"],"abstract":"We address temporal action localization in untrimmed long videos. This is\nimportant because videos in real applications are usually unconstrained and\ncontain multiple action instances plus video content of background scenes or\nother activities. To address this challenging issue, we exploit the\neffectiveness of deep networks in temporal action localization via three\nsegment-based 3D ConvNets: (1) a proposal network identifies candidate segments\nin a long video that may contain actions; (2) a classification network learns\none-vs-all action classification model to serve as initialization for the\nlocalization network; and (3) a localization network fine-tunes on the learned\nclassification network to localize each action instance. We propose a novel\nloss function for the localization network to explicitly consider temporal\noverlap and therefore achieve high temporal localization accuracy. Only the\nproposal network and the localization network are used during prediction. On\ntwo large-scale benchmarks, our approach achieves significantly superior\nperformances compared with other state-of-the-art systems: mAP increases from\n1.7% to 7.4% on MEXaction2 and increases from 15.0% to 19.0% on THUMOS 2014,\nwhen the overlap threshold for evaluation is set to 0.5.","url_abs":"http://arxiv.org/abs/1601.02129v2","url_pdf":"http://arxiv.org/pdf/1601.02129v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"temporal-action-localization-in-untrimmed","repo_url":"https://github.com/zhengshou/scnn","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"none","reach":null}],"tasks":[{"task_slug":"action-classification","task_name":"Action Classification"},{"task_slug":"action-localization","task_name":"Action Localization"},{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"},{"task_slug":"temporal-localization","task_name":"Temporal Localization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-recognition-in-videos-on-thumos14","task":"Action Recognition","dataset":"THUMOS’14","model":"Shou et. al.","rank_in_archive_order":9,"of":10,"metrics":{"mAP@0.1":"47.7","mAP@0.2":"43.5","mAP@0.3":"36.3","mAP@0.4":"28.7","mAP@0.5":"19.0"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-localization-on-mexaction2","task":"Temporal Action Localization","dataset":"MEXaction2","model":"S-CNN","rank_in_archive_order":1,"of":1,"metrics":{"mAP":"7.4"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-localization-on-thumos14","task":"Temporal Action Localization","dataset":"THUMOS’14","model":"S-CNN","rank_in_archive_order":38,"of":42,"metrics":{"mAP IOU@0.1":"47.7","mAP IOU@0.2":"43.5","mAP IOU@0.3":"36.3","mAP IOU@0.4":"28.7","mAP IOU@0.5":"19"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}