{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/just-ask-learning-to-answer-questions-from","title":"Just Ask: Learning to Answer Questions from Millions of Narrated Videos","arxiv_id":"2012.00451","date":"2020-12-01","proceeding":"ICCV 2021 10","authors":["Antoine Yang","Antoine Miech","Josef Sivic","Ivan Laptev","Cordelia Schmid"],"abstract":"Recent methods for visual question answering rely on large-scale annotated datasets. Manual annotation of questions and answers for videos, however, is tedious, expensive and prevents scalability. In this work, we propose to avoid manual annotation and generate a large-scale training dataset for video question answering making use of automatic cross-modal supervision. We leverage a question generation transformer trained on text data and use it to generate question-answer pairs from transcribed video narrations. Given narrated videos, we then automatically generate the HowToVQA69M dataset with 69M video-question-answer triplets. To handle the open vocabulary of diverse answers in this dataset, we propose a training procedure based on a contrastive loss between a video-question multi-modal transformer and an answer transformer. We introduce the zero-shot VideoQA task and show excellent results, in particular for rare answers. Furthermore, we demonstrate our method to significantly outperform the state of the art on MSRVTT-QA, MSVD-QA, ActivityNet-QA and How2QA. Finally, for a detailed evaluation we introduce iVQA, a new VideoQA dataset with reduced language biases and high-quality redundant manual annotations. Our code, datasets and trained models are available at https://antoyang.github.io/just-ask.html.","url_abs":"https://arxiv.org/abs/2012.00451v3","url_pdf":"https://arxiv.org/pdf/2012.00451v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"just-ask-learning-to-answer-questions-from","repo_url":"https://github.com/antoyang/just-ask","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"question-answering","task_name":"Question Answering"},{"task_slug":"question-generation","task_name":"Question Generation"},{"task_slug":"question-generation","task_name":"Question-Generation"},{"task_slug":"video-question-answering","task_name":"Video Question Answering"},{"task_slug":"visual-question-answering-1","task_name":"Visual Question Answering"},{"task_slug":"visual-question-answering","task_name":"Visual Question Answering (VQA)"},{"task_slug":"zero-shot-learning","task_name":"Zero-Shot Learning"}],"methods":[],"datasets_introduced":[{"slug":"sqa69m","name":"HowToVQA69M","full_name":"HowToVQA69M"},{"slug":"ivqa","name":"iVQA","full_name":"Instructional Video Question Answering"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"Just Ask (fine-tune)","rank_in_archive_order":26,"of":36,"metrics":{"Accuracy":"38.9"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-activitynet-qa","task":"Video Question Answering","dataset":"ActivityNet-QA","model":"Just Ask (0-shot)","rank_in_archive_order":36,"of":36,"metrics":{"Accuracy":"12.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-how2qa","task":"Video Question Answering","dataset":"How2QA","model":"Just Ask","rank_in_archive_order":3,"of":8,"metrics":{"Accuracy":"84.4"},"uses_additional_data":true},{"leaderboard":"/sota/video-question-answering-on-how2qa","task":"Video Question Answering","dataset":"How2QA","model":"Just Ask (0-shot)","rank_in_archive_order":8,"of":8,"metrics":{"Accuracy":"51.1"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-videoqa","task":"Video Question Answering","dataset":"VideoQA","model":"Just Ask (fine-tune)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"15.6"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-ivqa","task":"Video Question Answering","dataset":"iVQA","model":"Just Ask (fine-tune)","rank_in_archive_order":5,"of":7,"metrics":{"Accuracy":"35.4"},"uses_additional_data":false},{"leaderboard":"/sota/video-question-answering-on-ivqa","task":"Video Question Answering","dataset":"iVQA","model":"Just Ask (0-shot)","rank_in_archive_order":7,"of":7,"metrics":{"Accuracy":"12.2"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-msrvtt-qa-2","task":"Visual Question Answering","dataset":"MSRVTT-QA","model":"Just Ask","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"0.415"},"uses_additional_data":false},{"leaderboard":"/sota/visual-question-answering-on-msvd-qa-2","task":"Visual Question Answering","dataset":"MSVD-QA","model":"Just Ask","rank_in_archive_order":2,"of":2,"metrics":{"Accuracy":"0.463"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2012.00451","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}