{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/turn-tap-temporal-unit-regression-network-for","title":"TURN TAP: Temporal Unit Regression Network for Temporal Action Proposals","arxiv_id":"1703.06189","date":"2017-03-17","proceeding":"ICCV 2017 10","authors":["Jiyang Gao","Zhenheng Yang","Chen Sun","Kan Chen","Ram Nevatia"],"abstract":"Temporal Action Proposal (TAP) generation is an important problem, as fast\nand accurate extraction of semantically important (e.g. human actions) segments\nfrom untrimmed videos is an important step for large-scale video analysis. We\npropose a novel Temporal Unit Regression Network (TURN) model. There are two\nsalient aspects of TURN: (1) TURN jointly predicts action proposals and refines\nthe temporal boundaries by temporal coordinate regression; (2) Fast computation\nis enabled by unit feature reuse: a long untrimmed video is decomposed into\nvideo units, which are reused as basic building blocks of temporal proposals.\nTURN outperforms the state-of-the-art methods under average recall (AR) by a\nlarge margin on THUMOS-14 and ActivityNet datasets, and runs at over 880 frames\nper second (FPS) on a TITAN X GPU. We further apply TURN as a proposal\ngeneration stage for existing temporal action localization pipelines, it\noutperforms state-of-the-art performance on THUMOS-14 and ActivityNet.","url_abs":"http://arxiv.org/abs/1703.06189v2","url_pdf":"http://arxiv.org/pdf/1703.06189v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"turn-tap-temporal-unit-regression-network-for","repo_url":"https://github.com/jiyanggao/TURN-TAP","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok"}}],"tasks":[{"task_slug":"action-localization","task_name":"Action Localization"},{"task_slug":null,"task_name":"GPU"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"},{"task_slug":"regression-1","task_name":"regression"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-recognition-in-videos-on-thumos14","task":"Action Recognition","dataset":"THUMOS’14","model":"TURN","rank_in_archive_order":8,"of":10,"metrics":{"mAP@0.3":"46.3","mAP@0.4":"35.3","mAP@0.5":"24.5"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-localization-on-thumos14","task":"Temporal Action Localization","dataset":"THUMOS’14","model":"TURN-FL-16 + S-CNN","rank_in_archive_order":36,"of":42,"metrics":{"mAP IOU@0.1":"54","mAP IOU@0.2":"50.9","mAP IOU@0.3":"44.1","mAP IOU@0.4":"34.9","mAP IOU@0.5":"25.6"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1703.06189","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}