{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/combining-global-and-local-attention-with","title":"Combining Global and Local Attention with Positional Encoding for Video Summarization","arxiv_id":null,"date":"2021-12-01","proceeding":"IEEE International Symposium on Multimedia (ISM) 2021 12","authors":["Evlampios Apostolidis","Georgios Balaouras","Vasileios Mezaris","Ioannis Patras"],"abstract":"This paper presents a new method for supervised video summarization. To overcome drawbacks of existing RNN-based summarization architectures, that relate to the modeling of long-range frames' dependencies and the ability to parallelize the training process, the developed model relies on the use of self-attention mechanisms to estimate the importance of video frames. Contrary to previous attention-based summarization approaches that model the frames' dependencies by observing the entire frame sequence, our method combines global and local multi-head attention mechanisms to discover different modelings of the frames' dependencies at different levels of granularity. Moreover, the utilized attention mechanisms integrate a component that encodes the temporal position of video frames - this is of major importance when producing a video summary. Experiments on two datasets (SumMe and TVSum) demonstrate the effectiveness of the proposed model compared to existing attention-based methods, and its competitiveness against other state-of-the-art supervised summarization approaches. An ablation study that focuses on our main proposed components, namely the use of global and local multi-head attention mechanisms in collaboration with an absolute positional encoding component, shows their relative contributions to the overall summarization performance.","url_abs":"https://www.iti.gr/~bmezaris/publications/ism2021a_preprint.pdf","url_pdf":"https://www.iti.gr/~bmezaris/publications/ism2021a_preprint.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"combining-global-and-local-attention-with","repo_url":"https://github.com/e-apostolidis/PGL-SUM","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"supervised-video-summarization","task_name":"Supervised Video Summarization"},{"task_slug":"video-summarization","task_name":"Video Summarization"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"early-stopping","method_name":"Early Stopping"},{"method_slug":"gradient-clipping","method_name":"Gradient Clipping"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"relative-position-encodings","method_name":"Relative Position Encodings"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"weight-decay","method_name":"Weight Decay"},{"method_slug":"xavier-initialization","method_name":"Xavier Initialization"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/supervised-video-summarization-on-summe","task":"Supervised Video Summarization","dataset":"SumMe","model":"PGL-SUM (maximum learning capacity)","rank_in_archive_order":1,"of":21,"metrics":{"F1-score (Canonical)":"57.1"},"uses_additional_data":false},{"leaderboard":"/sota/supervised-video-summarization-on-summe","task":"Supervised Video Summarization","dataset":"SumMe","model":"PGL-SUM","rank_in_archive_order":2,"of":21,"metrics":{"F1-score (Canonical)":"55.6"},"uses_additional_data":false},{"leaderboard":"/sota/supervised-video-summarization-on-tvsum","task":"Supervised Video Summarization","dataset":"TvSum","model":"PGL-SUM (maximum learning capacity)","rank_in_archive_order":8,"of":21,"metrics":{"F1-score (Canonical)":"62.7"},"uses_additional_data":false},{"leaderboard":"/sota/supervised-video-summarization-on-tvsum","task":"Supervised Video Summarization","dataset":"TvSum","model":"PGL-SUM","rank_in_archive_order":12,"of":21,"metrics":{"F1-score (Canonical)":"61.0","Kendall's Tau":"0.157","Spearman's Rho":"0.206"},"uses_additional_data":false},{"leaderboard":"/sota/video-summarization-on-summe","task":"Video Summarization","dataset":"SumMe","model":"PGL-SUM","rank_in_archive_order":1,"of":6,"metrics":{"F1-score (Canonical)":"55.6"},"uses_additional_data":false},{"leaderboard":"/sota/video-summarization-on-tvsum","task":"Video Summarization","dataset":"TvSum","model":"PGL-SUM","rank_in_archive_order":5,"of":6,"metrics":{"F1-score (Canonical)":"61.0"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}