{"url":"/dataset/how2","name":"How2","full_name":null,"description_markdown":"The **How2** dataset contains 13,500 videos, or 300 hours of speech, and is split into 185,187 training, 2022 development (dev), and 2361 test utterances. It has subtitles in English and crowdsourced Portuguese translations.\r\n\r\nSource: [exploring multiview correlations in open-domain videos](https://arxiv.org/abs/1811.08890)","description_withheld":null,"homepage":"https://srvk.github.io/how2-dataset/","introduced_date":"2018-01-01","introduced_date_note":null,"introduced_by":{"paper":"/paper/how2-a-large-scale-dataset-for-multimodal","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","first_author":"Ramon Sanabria","url":null},"license":{"name":"CC BY-SA 4.0","url":"https://github.com/srvk/how2-dataset#how2-license"},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Texts","url":"/datasets/modality/texts"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Text Summarization","url":"/task/text-summarization","datasets_with_task":"/datasets/task/text-summarization"},{"name":"Audio-Visual Speech Recognition","url":"/task/audio-visual-speech-recognition","datasets_with_task":"/datasets/task/audio-visual-speech-recognition"},{"name":"Multimodal Abstractive Text Summarization","url":"/task/multimodal-abstractive-text-summarization","datasets_with_task":"/datasets/task/multimodal-abstractive-text-summarization"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Portuguese","url":"/datasets/language/portuguese"}],"variants":["How2","How2 300h"],"data_loaders":[],"num_papers_in_archive":84,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/text-summarization-on-how2","task":"Text Summarization","dataset_variant":"How2","rows":2,"metrics":["Content F1","ROUGE-L","ROUGE-1"],"first_row_in_archive_order":{"model":"Ground-truth transcript + Action with Hierarchical Attn","paper":"/paper/multimodal-abstractive-summarization-for-how2","metrics":{"Content F1":"48.9","ROUGE-L":"54.9"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/multimodal-abstractive-text-summarization-on","task":"Multimodal Abstractive Text Summarization","dataset_variant":"How2 300h","rows":1,"metrics":["ROUGE-L"],"first_row_in_archive_order":{"model":"MAST","paper":"/paper/mast-multimodal-abstractive-summarization","metrics":{"ROUGE-L":"43.23"},"code_links":[{"title":"amankhullar/mast","url":"https://github.com/amankhullar/mast"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/mast-multimodal-abstractive-summarization","title":"MAST: Multimodal Abstractive Summarization with Trimodal Hierarchical Attention","date":"2020-10-15","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/abstractive-summarization-of-spoken","title":"Abstractive Summarization of Spoken andWritten Instructions with BERT","date":"2020-08-21","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/multimodal-abstractive-summarization-for-how2","title":"Multimodal Abstractive Summarization for How2 Videos","date":"2019-06-19","rows_on_this_dataset":1,"code_links":0,"syntology":null}],"syntology_totals":{"read_at":"2026-09-25T09:33:49+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}