{"url":"/dataset/epic-kitchens-100","name":"EPIC-KITCHENS-100","full_name":null,"description_markdown":"This paper introduces the pipeline to scale the largest dataset in egocentric vision EPIC-KITCHENS. The effort culminates in EPIC-KITCHENS-100, a collection of 100 hours, 20M frames, 90K actions in 700 variable-length videos, capturing long-term unscripted activities in 45 environments, using head-mounted cameras. Compared to its previous version (EPIC-KITCHENS-55), EPIC-KITCHENS-100 has been annotated using a novel pipeline that allows denser (54% more actions per minute) and more complete annotations of fine-grained actions (+128% more action segments). This collection also enables evaluating the \"test of time\" - i.e. whether models trained on data collected in 2018 can generalise to new footage collected under the same hypotheses albeit \"two years on\".\r\nThe dataset is aligned with 6 challenges: action recognition (full and weak supervision), action detection, action anticipation, cross-modal retrieval (from captions), as well as unsupervised domain adaptation for action recognition. For each challenge, we define the task, provide baselines and evaluation metrics.","description_withheld":null,"homepage":"https://epic-kitchens.github.io/2021","introduced_date":"2020-06-23","introduced_date_note":null,"introduced_by":{"paper":"/paper/rescaling-egocentric-vision","title":"Rescaling Egocentric Vision","first_author":"Dima Damen","url":null},"license":{"name":"CC BY NC 4.0","url":"https://epic-kitchens.github.io/2021"},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Action Recognition","url":"/task/action-recognition-in-videos","datasets_with_task":"/datasets/task/action-recognition-in-videos"},{"name":"Temporal Action Localization","url":"/task/action-recognition","datasets_with_task":"/datasets/task/action-recognition"},{"name":"Unsupervised Domain Adaptation","url":"/task/unsupervised-domain-adaptation","datasets_with_task":"/datasets/task/unsupervised-domain-adaptation"},{"name":"Audio Classification","url":"/task/audio-classification","datasets_with_task":"/datasets/task/audio-classification"},{"name":"Action Anticipation","url":"/task/action-anticipation","datasets_with_task":"/datasets/task/action-anticipation"},{"name":"Open Vocabulary Action Recognition","url":"/task/open-vocabulary-action-recognition","datasets_with_task":"/datasets/task/open-vocabulary-action-recognition"},{"name":"Multi-Instance Retrieval","url":"/task/multi-instance-retrieval","datasets_with_task":"/datasets/task/multi-instance-retrieval"}],"languages":[{"name":"English","url":"/datasets/language/english"}],"variants":["EPIC-KITCHENS-100"],"data_loaders":[],"num_papers_in_archive":162,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/action-recognition-on-epic-kitchens-100","task":"Action Recognition","dataset_variant":"EPIC-KITCHENS-100","rows":32,"metrics":["Action@1","Verb@1","Noun@1","GFLOPs"],"first_row_in_archive_order":{"model":"LLaVAction","paper":"/paper/llavaction-evaluating-and-training-multi","metrics":{"Action@1":"58.3","Noun@1":"69","Verb@1":"76"},"code_links":[{"title":"adaptivemotorcontrollab/llavaction","url":"https://github.com/adaptivemotorcontrollab/llavaction"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/action-anticipation-on-epic-kitchens-100","task":"Action Anticipation","dataset_variant":"EPIC-KITCHENS-100","rows":9,"metrics":["Recall@5","Top-5 Verb","Top-5 Noun"],"first_row_in_archive_order":{"model":"PlausiVL","paper":"/paper/can-t-make-an-omelette-without-breaking-some","metrics":{"Recall@5":"27.60","Top-5 Noun":"54.23","Top-5 Verb":"55.62"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/temporal-action-localization-on-epic-kitchens","task":"Temporal Action Localization","dataset_variant":"EPIC-KITCHENS-100","rows":6,"metrics":["Avg mAP (0.1-0.5)","mAP IOU@0.1","mAP IOU@0.2","mAP IOU@0.3","mAP IOU@0.4","mAP IOU@0.5"],"first_row_in_archive_order":{"model":"AdaTAD (verb, VideoMAE-L)","paper":"/paper/end-to-end-temporal-action-detection-with-1b","metrics":{"Avg mAP (0.1-0.5)":"29.3","mAP IOU@0.1":"33.1","mAP IOU@0.2":"32.2","mAP IOU@0.3":"30.4","mAP IOU@0.4":"27.5","mAP IOU@0.5":"23.1"},"code_links":[{"title":"sming256/OpenTAD","url":"https://github.com/sming256/OpenTAD"},{"title":"sming256/AdaTAD","url":"https://github.com/sming256/AdaTAD"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/unsupervised-domain-adaptation-on-epic","task":"Unsupervised Domain Adaptation","dataset_variant":"EPIC-KITCHENS-100","rows":5,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"TranSVAE","paper":null,"metrics":{"Average Accuracy":"52.6"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/audio-classification-on-epic-kitchens-100","task":"Audio Classification","dataset_variant":"EPIC-KITCHENS-100","rows":4,"metrics":["Top-1 Action","Top-1 Noun","Top-1 Verb","Top-5 Action","Top-5 Noun","Top-5 Verb"],"first_row_in_archive_order":{"model":"Audiovisual Masked Autoencoder\n(Audiovisual, Single)","paper":"/paper/audiovisual-masked-autoencoders","metrics":{"Top-1 Action":"46.0","Top-1 Noun":"56.4","Top-1 Verb":"71.4"},"code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic/tree/main/scenic/projects/av_mae"},{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/open-vocabulary-action-recognition-on-epic","task":"Open Vocabulary Action Recognition","dataset_variant":"EPIC-KITCHENS-100","rows":1,"metrics":["HM"],"first_row_in_archive_order":{"model":"OAP+AOP","paper":"/paper/opening-the-vocabulary-of-egocentric-actions-1","metrics":{"HM":"17.0"},"code_links":[{"title":"dibschat/openvocab-egoAR","url":"https://github.com/dibschat/openvocab-egoAR"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/llavaction-evaluating-and-training-multi","title":"LLaVAction: evaluating and training multi-modal large language models for action recognition","date":"2025-03-24","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/extending-video-masked-autoencoders-to-128-1","title":"Extending Video Masked Autoencoders to 128 frames","date":"2024-11-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/semantically-guided-representation-learning","title":"Semantically Guided Representation Learning For Action Anticipation","date":"2024-07-02","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":8,"samples_ran":6,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/can-t-make-an-omelette-without-breaking-some","title":"Can't make an Omelette without Breaking some Eggs: Plausible Action Anticipation using Large Video-Language Models","date":"2024-05-30","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/tim-a-time-interval-machine-for-audio-visual","title":"TIM: A Time Interval Machine for Audio-Visual Action Recognition","date":"2024-04-08","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":12,"samples_ran":11,"samples_unverified":1,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/uncertainty-aware-action-decoupling","title":"Uncertainty-aware Action Decoupling Transformer for Action Anticipation","date":"2024-01-01","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/cast-cross-attention-in-space-and-time-for-1","title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","date":"2023-11-30","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":17,"samples_ran":9,"samples_unverified":8,"pointer_only_for_licence":17,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/end-to-end-temporal-action-detection-with-1b","title":"End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames","date":"2023-11-28","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/training-a-large-video-model-on-a-single","title":"Training a Large Video Model on a Single Machine in a Day","date":"2023-09-28","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/opening-the-vocabulary-of-egocentric-actions-1","title":"Opening the Vocabulary of Egocentric Actions","date":"2023-08-22","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/temporally-adaptive-models-for-efficient","title":"Temporally-Adaptive Models for Efficient Video Understanding","date":"2023-08-10","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporalmaxer-maximize-temporal-context-with","title":"TemporalMaxer: Maximize Temporal Context with only Max Pooling for Temporal Action Localization","date":"2023-03-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/tridet-temporal-action-detection-with","title":"TriDet: Temporal Action Detection with Relative Boundary Modeling","date":"2023-03-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":15,"samples_ran":5,"samples_unverified":10,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/audiovisual-masked-autoencoders","title":"Audiovisual Masked Autoencoders","date":"2022-12-09","rows_on_this_dataset":3,"code_links":2,"syntology":null},{"paper":"/paper/learning-video-representations-from-large","title":"Learning Video Representations from Large Language Models","date":"2022-12-08","rows_on_this_dataset":1,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":20,"samples_ran":6,"samples_unverified":14,"pointer_only_for_licence":20,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/interaction-visual-transformer-for-egocentric","title":"Interaction Region Visual Transformer for Egocentric Action Anticipation","date":"2022-11-25","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/anticipative-feature-fusion-transformer-for","title":"Anticipative Feature Fusion Transformer for Multi-Modal Action Anticipation","date":"2022-10-23","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/play-it-back-iterative-attention-for-audio","title":"Play It Back: Iterative Attention for Audio Recognition","date":"2022-10-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/multiscale-multimodal-transformer-for","title":"Multiscale Multimodal Transformer for Multimodal Action Recognition","date":"2022-09-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/avt-audio-video-transformer-for-multimodal","title":"AVT: Audio-Video Transformer for Multimodal Action Recognition","date":"2022-09-22","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/m-m-mix-a-multimodal-multiview-transformer","title":"M&M Mix: A Multimodal Multiview Transformer Ensemble","date":"2022-06-20","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/gate-shift-fuse-for-video-action-recognition","title":"Gate-Shift-Fuse for Video Action Recognition","date":"2022-03-16","rows_on_this_dataset":1,"code_links":2,"syntology":null},{"paper":"/paper/actionformer-localizing-moments-of-actions","title":"ActionFormer: Localizing Moments of Actions with Transformers","date":"2022-02-16","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/omnivore-a-single-model-for-many-visual","title":"Omnivore: A Single Model for Many Visual Modalities","date":"2022-01-20","rows_on_this_dataset":1,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/memvit-memory-augmented-multiscale-vision","title":"MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video Recognition","date":"2022-01-20","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/multiview-transformers-for-video-recognition","title":"Multiview Transformers for Video Recognition","date":"2022-01-12","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/contrast-and-mix-temporal-contrastive-video","title":"Contrast and Mix: Temporal Contrastive Video Domain Adaptation with Background Mixing","date":"2021-10-28","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/object-region-video-transformers-1","title":"Object-Region Video Transformers","date":"2021-10-13","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":7,"samples_ran":1,"samples_unverified":6,"pointer_only_for_licence":7,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/attention-bottlenecks-for-multimodal-fusion","title":"Attention Bottlenecks for Multimodal Fusion","date":"2021-06-30","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/keeping-your-eye-on-the-ball-trajectory","title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","date":"2021-06-09","rows_on_this_dataset":3,"code_links":2,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":1,"samples_unverified":1,"pointer_only_for_licence":2,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/technical-report-temporal-aggregate","title":"Technical Report: Temporal Aggregate Representations","date":"2021-06-06","rows_on_this_dataset":2,"code_links":1,"syntology":null},{"paper":"/paper/anticipative-video-transformer","title":"Anticipative Video Transformer","date":"2021-06-03","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":2,"samples_ran":2,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/2103-15691","title":"ViViT: A Video Vision Transformer","date":"2021-03-29","rows_on_this_dataset":1,"code_links":10,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":21,"samples_ran":14,"samples_unverified":7,"pointer_only_for_licence":1,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/movinets-mobile-video-networks-for-efficient","title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","date":"2021-03-21","rows_on_this_dataset":5,"code_links":3,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":13,"samples_ran":8,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/rescaling-egocentric-vision","title":"Rescaling Egocentric Vision","date":"2020-06-23","rows_on_this_dataset":6,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":3,"samples_unverified":15,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/g-tad-sub-graph-localization-for-temporal","title":"G-TAD: Sub-Graph Localization for Temporal Action Detection","date":"2019-11-26","rows_on_this_dataset":1,"code_links":7,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":18,"samples_ran":3,"samples_unverified":15,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporal-attentive-alignment-for-large-scale","title":"Temporal Attentive Alignment for Large-Scale Video Domain Adaptation","date":"2019-07-30","rows_on_this_dataset":1,"code_links":5,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":10,"samples_ran":3,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/bmn-boundary-matching-network-for-temporal","title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","date":"2019-07-23","rows_on_this_dataset":1,"code_links":15,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":11,"samples_ran":3,"samples_unverified":8,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/adversarial-discriminative-domain-adaptation","title":"Adversarial Discriminative Domain Adaptation","date":"2017-02-17","rows_on_this_dataset":1,"code_links":20,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":48,"samples_ran":14,"samples_unverified":34,"pointer_only_for_licence":12,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/domain-adversarial-training-of-neural","title":"Domain-Adversarial Training of Neural Networks","date":"2015-05-28","rows_on_this_dataset":1,"code_links":37,"syntology":{"read_at":"2026-09-24T18:15:14+00:00","samples_harvested":52,"samples_ran":33,"samples_unverified":19,"pointer_only_for_licence":22,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}}],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":18,"samples_harvested":278,"samples_ran":126,"samples_unverified":152,"pointer_only_for_licence":94,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}