{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/improve-temporal-action-proposals-using","title":"Improve Temporal Action Proposals using Hierarchical Context","arxiv_id":null,"date":"2023-04-03","proceeding":"Pattern Recognition 2023 4","authors":["Qinying Liu","Zilei Wang","Shenghai Rong"],"abstract":"Temporal action proposal (TAP) aims to generate accurate candidates of action instances in an untrimmed video. It has been proved that contexts are critically important to this task. In this paper, we propose a novel hierarchical context network (HCN) to further explore the snippet-level and proposal-level contexts, which are used to improve the representations of snippets and proposals, respectively. First, we pinpoint that different scales of snippet-level contexts are not equally important for different action instances. To this end, we incorporate a novel gating mechanism into the U-Net structure to capture the content-adaptive snippet-level contexts. Second, to exploit the proposal-level contexts, we propose a task-specific self-attention model with high efficiency. By stacking multiple attention models, we can deeply explore the proposal-level contexts in a wide range. Finally, to leverage both levels of context, we equip HCN with three branches to evaluate proposals from local to global perspectives. Our experiments on the ActivityNet-1.3 and THUMOS14 datasets show that HCN significantly outperforms previous TAP methods. Additionally, further experiments demonstrate that our method can substantially improve the state-of-the-art action detection performance when combined with existing action classifiers.","url_abs":"https://www.sciencedirect.com/science/article/pii/S0031320323002601","url_pdf":"https://www.sciencedirect.com/science/article/pii/S0031320323002601","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"action-detection","task_name":"Action Detection"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"},{"task_slug":"temporal-action-proposal-generation","task_name":"Temporal Action Proposal Generation"}],"methods":[{"method_slug":"concatenated-skip-connection","method_name":"Concatenated Skip Connection"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"u-net","method_name":"U-Net"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/temporal-action-localization-on-activitynet","task":"Temporal Action Localization","dataset":"ActivityNet-1.3","model":"HCN(I3D features)","rank_in_archive_order":19,"of":33,"metrics":{"mAP":"35.61","mAP IOU@0.5":"52.51","mAP IOU@0.75":"36.10","mAP IOU@0.95":"7.12"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-proposal-generation-on","task":"Temporal Action Proposal Generation","dataset":"ActivityNet-1.3","model":"HCN","rank_in_archive_order":3,"of":11,"metrics":{"AR@100":"77.13","AUC (val)":"68.78"},"uses_additional_data":false},{"leaderboard":"/sota/temporal-action-proposal-generation-on-thumos","task":"Temporal Action Proposal Generation","dataset":"THUMOS' 14","model":"HCH","rank_in_archive_order":1,"of":3,"metrics":{"AR@100":"50.86","AR@1000":"67.34","AR@200":"57.56","AR@50":"64.28"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}