{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/multimodal-abstractive-summarization-for-how2","title":"Multimodal Abstractive Summarization for How2 Videos","arxiv_id":"1906.07901","date":"2019-06-19","proceeding":"ACL 2019 7","authors":["Shruti Palaskar","Jindrich Libovický","Spandana Gella","Florian Metze"],"abstract":"In this paper, we study abstractive summarization for open-domain videos. Unlike the traditional text news summarization, the goal is less to \"compress\" text information but rather to provide a fluent textual summary of information that has been collected and fused from different source modalities, in our case video and audio transcripts (or text). We show how a multi-source sequence-to-sequence model with hierarchical attention can integrate information from different modalities into a coherent output, compare various models trained with different modalities and present pilot experiments on the How2 corpus of instructional videos. We also propose a new evaluation metric (Content F1) for abstractive summarization task that measures semantic adequacy rather than fluency of the summaries, which is covered by metrics like ROUGE and BLEU.","url_abs":"https://arxiv.org/abs/1906.07901v1","url_pdf":"https://arxiv.org/pdf/1906.07901v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"abstractive-text-summarization","task_name":"Abstractive Text Summarization"},{"task_slug":"news-summarization","task_name":"News Summarization"},{"task_slug":"text-summarization","task_name":"Text Summarization"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-summarization-on-how2","task":"Text Summarization","dataset":"How2","model":"Ground-truth transcript + Action with Hierarchical Attn","rank_in_archive_order":1,"of":2,"metrics":{"Content F1":"48.9","ROUGE-L":"54.9"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1906.07901","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}