{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/moments-in-time-dataset-one-million-videos","title":"Moments in Time Dataset: one million videos for event understanding","arxiv_id":"1801.03150","date":"2018-01-09","proceeding":null,"authors":["Mathew Monfort","Alex Andonian","Bolei Zhou","Kandan Ramakrishnan","Sarah Adel Bargal","Tom Yan","Lisa Brown","Quanfu Fan","Dan Gutfruend","Carl Vondrick","Aude Oliva"],"abstract":"We present the Moments in Time Dataset, a large-scale human-annotated\ncollection of one million short videos corresponding to dynamic events\nunfolding within three seconds. Modeling the spatial-audio-temporal dynamics\neven for actions occurring in 3 second videos poses many challenges: meaningful\nevents do not include only people, but also objects, animals, and natural\nphenomena; visual and auditory events can be symmetrical in time (\"opening\" is\n\"closing\" in reverse), and either transient or sustained. We describe the\nannotation process of our dataset (each video is tagged with one action or\nactivity label among 339 different classes), analyze its scale and diversity in\ncomparison to other large-scale video datasets for action recognition, and\nreport results of several baseline models addressing separately, and jointly,\nthree modalities: spatial, temporal and auditory. The Moments in Time dataset,\ndesigned to have a large coverage and diversity of events in both visual and\nauditory modalities, can serve as a new challenge to develop models that scale\nto the level of complexity and abstract reasoning that a human processes on a\ndaily basis.","url_abs":"http://arxiv.org/abs/1801.03150v3","url_pdf":"http://arxiv.org/pdf/1801.03150v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"moments-in-time-dataset-one-million-videos","repo_url":"https://github.com/metalbubble/moments_models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"BSD-2-Clause"}},{"paper_slug":"moments-in-time-dataset-one-million-videos","repo_url":"https://github.com/shubhambitsg/activity-recognition","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"moments-in-time-dataset-one-million-videos","repo_url":"https://github.com/thefonseca/predictive-coding","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"moments-in-time-dataset-one-million-videos","repo_url":"https://github.com/zhoubolei/moments_models","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"BSD-2-Clause"}}],"tasks":[{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"diversity","task_name":"Diversity"},{"task_slug":"multimodal-activity-recognition","task_name":"Multimodal Activity Recognition"},{"task_slug":"action-recognition","task_name":"Temporal Action Localization"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-recognition-in-videos-on-something-1","task":"Action Recognition","dataset":"Something-Something V1","model":"ResNet50 I3D (Moments pretrained)","rank_in_archive_order":52,"of":74,"metrics":{"Top 1 Accuracy":"50"},"uses_additional_data":true},{"leaderboard":"/sota/action-recognition-in-videos-on-something-1","task":"Action Recognition","dataset":"Something-Something V1","model":"ResNet50 I3D (Kinetics pretrained)","rank_in_archive_order":60,"of":74,"metrics":{"Top 1 Accuracy":"48.6"},"uses_additional_data":true},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","task":"Multimodal Activity Recognition","dataset":"Moments in Time Dataset","model":"Ensemble (SVM)","rank_in_archive_order":2,"of":6,"metrics":{"Top-1 (%)":"31.16","Top-5 (%)":"57.67"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","task":"Multimodal Activity Recognition","dataset":"Moments in Time Dataset","model":"I3D","rank_in_archive_order":3,"of":6,"metrics":{"Top-1 (%)":"29.51","Top-5 (%)":"56.06"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","task":"Multimodal Activity Recognition","dataset":"Moments in Time Dataset","model":"TRN-Multiscale","rank_in_archive_order":4,"of":6,"metrics":{"Top-1 (%)":"28.27","Top-5 (%)":"53.87"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","task":"Multimodal Activity Recognition","dataset":"Moments in Time Dataset","model":"TSN-Flow","rank_in_archive_order":5,"of":6,"metrics":{"Top-1 (%)":"15.71","Top-5 (%)":"34.65"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-activity-recognition-on-moments-in","task":"Multimodal Activity Recognition","dataset":"Moments in Time Dataset","model":"SoundNet","rank_in_archive_order":6,"of":6,"metrics":{"Top-1 (%)":"7.60","Top-5 (%)":"18.00"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1801.03150","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}