{"url":"/task/action-recognition-in-videos","name":"Action Recognition","slug":"action-recognition-in-videos","description_markdown":"**Action Recognition** is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.\r\n\r\nIn the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos. \r\n\r\nPlease note some benchmarks may be located in the [Action Classification](https://paperswithcode.com/task/action-classification) or [Video Classification](https://paperswithcode.com/task/video-classification) tasks, e.g. Kinetics-400.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Time Series","url":"/area/time-series"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":2759,"papers_with_code":1058,"benchmarks":56,"benchmark_tables_in_archive":56,"benchmark_tables_shown":56,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":115,"subtasks":15,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/action-recognition-in-videos-on-something","slug":"action-recognition-in-videos-on-something","dataset":"Something-Something V2","dataset_url":"/dataset/something-something-v2","rows_in_archive":123,"metrics":["Top-1 Accuracy","Top-5 Accuracy","Parameters","GFLOPs"],"first_row_in_archive_order":{"model":"MVD (Kinetics400 pretrain, ViT-H, 16 frame)","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_url":"/paper/masked-video-distillation-rethinking-masked","paper_date":"2022-12-08","arxiv_id":"2212.04500","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf101","slug":"action-recognition-in-videos-on-ucf101","dataset":"UCF101","dataset_url":"/dataset/ucf101","rows_in_archive":91,"metrics":["3-fold Accuracy","Accuracy","Accuracy 20%Test"],"first_row_in_archive_order":{"model":"FTP-UniFormerV2-L/14","paper_title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","paper_url":"/paper/enhancing-video-transformers-for-action","paper_date":"2024-03-24","arxiv_id":"2403.16128","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-hmdb-51","slug":"action-recognition-in-videos-on-hmdb-51","dataset":"HMDB-51","dataset_url":"/dataset/hmdb51","rows_in_archive":77,"metrics":["Average accuracy of 3 splits"],"first_row_in_archive_order":{"model":"VideoMAE V2-g","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","paper_url":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_date":"2023-03-29","arxiv_id":"2303.16727","code_links":[{"title":"OpenGVLab/VideoMAEv2","url":"https://github.com/OpenGVLab/VideoMAEv2"}],"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-in-videos-on-something-1","slug":"action-recognition-in-videos-on-something-1","dataset":"Something-Something V1","dataset_url":"/dataset/something-something-v1","rows_in_archive":74,"metrics":["Top 1 Accuracy","Top 5 Accuracy","Param.","GFLOPs"],"first_row_in_archive_order":{"model":"InternVideo","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","paper_url":"/paper/internvideo-general-video-foundation-models","paper_date":"2022-12-06","arxiv_id":"2212.03191","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-on-ava-v2-2","slug":"action-recognition-on-ava-v2-2","dataset":"AVA v2.2","dataset_url":"/dataset/ava","rows_in_archive":38,"metrics":["mAP"],"first_row_in_archive_order":{"model":"LART (Hiera-H, K700 PT+FT)","paper_title":"On the Benefits of 3D Pose and Tracking for Human Action Recognition","paper_url":"/paper/on-the-benefits-of-3d-pose-and-tracking-for","paper_date":"2023-04-03","arxiv_id":"2304.01199","code_links":[{"title":"brjathu/LART","url":"https://github.com/brjathu/LART"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-epic-kitchens-100","slug":"action-recognition-on-epic-kitchens-100","dataset":"EPIC-KITCHENS-100","dataset_url":"/dataset/epic-kitchens-100","rows_in_archive":32,"metrics":["Action@1","Verb@1","Noun@1","GFLOPs"],"first_row_in_archive_order":{"model":"LLaVAction","paper_title":"LLaVAction: evaluating and training multi-modal large language models for action recognition","paper_url":"/paper/llavaction-evaluating-and-training-multi","paper_date":"2025-03-24","arxiv_id":"2503.18712","code_links":[{"title":"adaptivemotorcontrollab/llavaction","url":"https://github.com/adaptivemotorcontrollab/llavaction"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd","slug":"action-recognition-in-videos-on-ntu-rgbd","dataset":"NTU RGB+D","dataset_url":"/dataset/ntu-rgb-d","rows_in_archive":28,"metrics":["Accuracy (CS)","Accuracy (CV)"],"first_row_in_archive_order":{"model":"DSCNet (RGB + Pose)","paper_title":"A Dense-Sparse Complementary Network for Human Action Recognition based on RGB and Skeleton Modalities","paper_url":"/paper/a-dense-sparse-complementary-network-for","paper_date":"2023-12-28","arxiv_id":null,"code_links":[{"title":"Maxchengqin/DSCNet","url":"https://github.com/Maxchengqin/DSCNet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ntu-rgbd-120","slug":"action-recognition-in-videos-on-ntu-rgbd-120","dataset":"NTU RGB+D 120","dataset_url":"/dataset/ntu-rgb-d-120","rows_in_archive":21,"metrics":["Accuracy (Cross-Setup)","Accuracy (Cross-Subject)"],"first_row_in_archive_order":{"model":"DSCNet (RGB + Pose)","paper_title":"A Dense-Sparse Complementary Network for Human Action Recognition based on RGB and Skeleton Modalities","paper_url":"/paper/a-dense-sparse-complementary-network-for","paper_date":"2023-12-28","arxiv_id":null,"code_links":[{"title":"Maxchengqin/DSCNet","url":"https://github.com/Maxchengqin/DSCNet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-diving-48","slug":"action-recognition-on-diving-48","dataset":"Diving-48","dataset_url":null,"rows_in_archive":18,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"LVMAE","paper_title":"Extending Video Masked Autoencoders to 128 frames","paper_url":"/paper/extending-video-masked-autoencoders-to-128-1","paper_date":"2024-11-20","arxiv_id":"2411.13683","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-activitynet","slug":"action-recognition-in-videos-on-activitynet","dataset":"ActivityNet","dataset_url":"/dataset/activitynet","rows_in_archive":16,"metrics":["mAP"],"first_row_in_archive_order":{"model":"Text4Vis (w/ ViT-L)","paper_title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","paper_url":"/paper/transferring-textual-knowledge-for-visual","paper_date":"2022-07-04","arxiv_id":"2207.01297","code_links":[{"title":"whwu95/Cap4Video","url":"https://github.com/whwu95/Cap4Video"},{"title":"whwu95/text4vis","url":"https://github.com/whwu95/text4vis"},{"title":"whwu95/GPT4Vis","url":"https://github.com/whwu95/GPT4Vis"},{"title":"whwu95/BIKE","url":"https://github.com/whwu95/BIKE"},{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ava-v21","slug":"action-recognition-in-videos-on-ava-v21","dataset":"AVA v2.1","dataset_url":"/dataset/ava","rows_in_archive":15,"metrics":["mAP (Val)","GFlops","Params (M)"],"first_row_in_archive_order":{"model":"STAR/L","paper_title":"End-to-End Spatio-Temporal Action Localisation with Video Transformers","paper_url":"/paper/end-to-end-spatio-temporal-action","paper_date":"2023-04-24","arxiv_id":"2304.12160","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-h2o-2-hands-and-objects","slug":"action-recognition-on-h2o-2-hands-and-objects","dataset":"H2O  (2 Hands and Objects)","dataset_url":"/dataset/h2o-dataset","rows_in_archive":11,"metrics":["Actions Top-1","RGB","Hand Pose","Object Pose","Object Label"],"first_row_in_archive_order":{"model":"HandFormer-B/21x8","paper_title":"On the Utility of 3D Hand Poses for Action Recognition","paper_url":"/paper/on-the-utility-of-3d-hand-poses-for-action","paper_date":"2024-03-14","arxiv_id":"2403.09805","code_links":[{"title":"s-shamil/HandFormer","url":"https://github.com/s-shamil/HandFormer"}],"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-in-videos-on-thumos14","slug":"action-recognition-in-videos-on-thumos14","dataset":"THUMOS’14","dataset_url":"/dataset/thumos14-1","rows_in_archive":10,"metrics":["mAP@0.5","mAP@0.1","mAP@0.2","mAP@0.3","mAP@0.4"],"first_row_in_archive_order":{"model":"BMN","paper_title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","paper_url":"/paper/bmn-boundary-matching-network-for-temporal","paper_date":"2019-07-23","arxiv_id":"1907.09702","code_links":[{"title":"PaddlePaddle/models","url":"https://github.com/PaddlePaddle/models/tree/develop/PaddleCV/video/models/bmn"},{"title":"PaddlePaddle/models","url":"https://github.com/PaddlePaddle/models/tree/develop/dygraph/bmn"},{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"PaddlePaddle/PaddleVideo","url":"https://github.com/PaddlePaddle/PaddleVideo/blob/develop/docs/zh-CN/model_zoo/localization/bmn.md"},{"title":"Tencent/ActionDetection-DBG","url":"https://github.com/Tencent/ActionDetection-DBG"},{"title":"JJBOY/BMN-Boundary-Matching-Network","url":"https://github.com/JJBOY/BMN-Boundary-Matching-Network"},{"title":"Frostinassiky/gtad","url":"https://github.com/Frostinassiky/gtad"},{"title":"xlliu7/BMN-Boundary-Matching-Network","url":"https://github.com/xlliu7/BMN-Boundary-Matching-Network"},{"title":"handhand123/prsa-net","url":"https://github.com/handhand123/prsa-net"},{"title":"Lechatelia/action-proposal-generation","url":"https://github.com/Lechatelia/action-proposal-generation"},{"title":"2024-MindSpore-1/Code6","url":"https://github.com/2024-MindSpore-1/Code6/tree/main/BMN"},{"title":"carpedkm/G_TAD_customizing","url":"https://github.com/carpedkm/G_TAD_customizing"},{"title":"2023-MindSpore-4/Code8","url":"https://github.com/2023-MindSpore-4/Code8/tree/main/BMN"},{"title":"2023-MindSpore-1/ms-code-17","url":"https://github.com/2023-MindSpore-1/ms-code-17/tree/main/BMN"},{"title":"MindSpore-paper-code-3/code6","url":"https://github.com/MindSpore-paper-code-3/code6/tree/main/BMN"}],"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-in-videos-on-sports-1m","slug":"action-recognition-in-videos-on-sports-1m","dataset":"Sports-1M","dataset_url":"/dataset/sports-1m","rows_in_archive":9,"metrics":["Video hit@1 ","Video hit@5","Clip Hit@1"],"first_row_in_archive_order":{"model":"ip-CSN-152 (RGB)","paper_title":"Video Classification with Channel-Separated Convolutional Networks","paper_url":"/paper/video-classification-with-channel-separated","paper_date":"2019-04-04","arxiv_id":"1904.02811","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"facebookresearch/R2Plus1D","url":"https://github.com/facebookresearch/R2Plus1D"},{"title":"facebookresearch/VMZ","url":"https://github.com/facebookresearch/VMZ"},{"title":"BB-Repos/BBaction","url":"https://github.com/BB-Repos/BBaction"},{"title":"salinasJJ/BBaction","url":"https://github.com/salinasJJ/BBaction"},{"title":"MindSpore-paper-code-2/code2","url":"https://github.com/MindSpore-paper-code-2/code2/tree/main/r2plus1d"},{"title":"Mind23-2/MindCode-62","url":"https://github.com/Mind23-2/MindCode-62"}],"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-on-hacs","slug":"action-recognition-on-hacs","dataset":"HACS","dataset_url":"/dataset/hacs","rows_in_archive":8,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-charades-ego","slug":"action-recognition-on-charades-ego","dataset":"Charades-Ego","dataset_url":"/dataset/charades-ego","rows_in_archive":6,"metrics":["mAP"],"first_row_in_archive_order":{"model":"LaViLa (Finetuned, TimeSformer-L)","paper_title":"Learning Video Representations from Large Language Models","paper_url":"/paper/learning-video-representations-from-large","paper_date":"2022-12-08","arxiv_id":"2212.04501","code_links":[{"title":"facebookresearch/lavila","url":"https://github.com/facebookresearch/lavila"},{"title":"Ziyang412/VideoTree","url":"https://github.com/Ziyang412/VideoTree"},{"title":"ceezh/llovi","url":"https://github.com/ceezh/llovi"}],"syntology":{"n":20,"n_ran":6,"n_unverified":14,"n_pointer_only":20}}},{"leaderboard":"/sota/action-recognition-in-videos-on-volleyball","slug":"action-recognition-in-videos-on-volleyball","dataset":"Volleyball","dataset_url":"/dataset/volleyball","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PoseC3D (Pose Only)","paper_title":"Revisiting Skeleton-based Action Recognition","paper_url":"/paper/revisiting-skeleton-based-action-recognition","paper_date":"2021-04-28","arxiv_id":"2104.13586","code_links":[{"title":"open-mmlab/mmaction2","url":"https://github.com/open-mmlab/mmaction2"},{"title":"kennymckormick/pyskl","url":"https://github.com/kennymckormick/pyskl"},{"title":"txyugood/PaddlePoseC3D","url":"https://github.com/txyugood/PaddlePoseC3D"},{"title":"sandman002/One-Style-is-All-You-Need-to-Generate-a-Video","url":"https://github.com/sandman002/One-Style-is-All-You-Need-to-Generate-a-Video"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-animal-kingdom","slug":"action-recognition-on-animal-kingdom","dataset":"Animal Kingdom","dataset_url":"/dataset/animal-kingdom","rows_in_archive":4,"metrics":["mAP"],"first_row_in_archive_order":{"model":"ARTEMIS: animal recognition through enhanced multimodal integration system","paper_title":null,"paper_url":null,"paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-bar","slug":"action-recognition-on-bar","dataset":"BAR","dataset_url":"/dataset/bar","rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"DebiAN","paper_title":"Discover and Mitigate Unknown Biases with Debiasing Alternate Networks","paper_url":"/paper/discover-and-mitigate-unknown-biases-with","paper_date":"2022-07-20","arxiv_id":"2207.10077","code_links":[{"title":"zhihengli-UR/DebiAN","url":"https://github.com/zhihengli-UR/DebiAN"}],"syntology":{"n":9,"n_ran":2,"n_unverified":7,"n_pointer_only":9}}},{"leaderboard":"/sota/action-recognition-on-haa500","slug":"action-recognition-on-haa500","dataset":"HAA500","dataset_url":"/dataset/haa500","rows_in_archive":4,"metrics":["Top-1 (%)"],"first_row_in_archive_order":{"model":"TSN","paper_title":"HAA500: Human-Centric Atomic Action Dataset with Curated Videos","paper_url":"/paper/haa500-human-centric-atomic-action-dataset","paper_date":"2020-09-11","arxiv_id":"2009.05224","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-lote-animal","slug":"action-recognition-on-lote-animal","dataset":"LoTE-Animal","dataset_url":"/dataset/lote-animal","rows_in_archive":4,"metrics":["Accuracy (Top-1)"],"first_row_in_archive_order":{"model":"SlowOnly r50","paper_title":"LoTE-Animal: A Long Time-span Dataset for Endangered Animal Behavior Understanding","paper_url":"/paper/lote-animal-a-long-time-span-dataset-for","paper_date":"2023-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-uav-human","slug":"action-recognition-on-uav-human","dataset":"UAV-Human","dataset_url":"/dataset/uav-human","rows_in_archive":4,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"PMI Sampler","paper_title":"PMI Sampler: Patch Similarity Guided Frame Selection for Aerial Action Recognition","paper_url":"/paper/pmi-sampler-patch-similarity-guided-frame","paper_date":"2023-04-14","arxiv_id":"2304.06866","code_links":[{"title":"ricky-xian/pmi-sampler","url":"https://github.com/ricky-xian/pmi-sampler"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-jester-gesture","slug":"action-recognition-on-jester-gesture","dataset":"Jester (Gesture Recognition)","dataset_url":"/dataset/jester-gesture-recognition","rows_in_archive":3,"metrics":["Val"],"first_row_in_archive_order":{"model":"DirecFormer","paper_title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","paper_url":"/paper/direcformer-a-directed-attention-in","paper_date":"2022-03-19","arxiv_id":"2203.10233","code_links":[{"title":"uark-cviu/direcformer","url":"https://github.com/uark-cviu/direcformer"}],"syntology":{"n":8,"n_ran":4,"n_unverified":4,"n_pointer_only":8}}},{"leaderboard":"/sota/action-recognition-on-rareact","slug":"action-recognition-on-rareact","dataset":"RareAct","dataset_url":"/dataset/rareact","rows_in_archive":3,"metrics":["mWAP"],"first_row_in_archive_order":{"model":"🦩 Flamingo","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","paper_url":"/paper/flamingo-a-visual-language-model-for-few-shot-1","paper_date":"2022-04-29","arxiv_id":"2204.14198","code_links":[{"title":"mlfoundations/open_flamingo","url":"https://github.com/mlfoundations/open_flamingo"},{"title":"lucidrains/flamingo-pytorch","url":"https://github.com/lucidrains/flamingo-pytorch"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"},{"title":"happen2me/cross-gnn","url":"https://github.com/happen2me/cross-gnn"}],"syntology":{"n":24,"n_ran":18,"n_unverified":6,"n_pointer_only":7}}},{"leaderboard":"/sota/action-recognition-on-real-life-violence","slug":"action-recognition-on-real-life-violence","dataset":"Real Life Violence Situations Dataset","dataset_url":"/dataset/real-life-violence-situations-dataset","rows_in_archive":3,"metrics":["accuracy"],"first_row_in_archive_order":{"model":"DeVTr","paper_title":"Data Efficient Video Transformer for Violence Detection","paper_url":"/paper/data-efficient-video-transformer-for-violence","paper_date":"2021-07-17","arxiv_id":null,"code_links":[{"title":"mamonraab/Data-efficient-video-transformer","url":"https://github.com/mamonraab/Data-efficient-video-transformer"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-icvl-4","slug":"action-recognition-in-videos-on-icvl-4","dataset":"ICVL-4","dataset_url":"/dataset/icvl","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"OHA-GCN (Two stream; HP + OHP-hands + informative samples)","paper_title":"Skeleton-based Action Recognition of People Handling Objects","paper_url":"/paper/skeleton-based-action-recognition-of-people","paper_date":"2019-01-21","arxiv_id":"1901.06882","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ird","slug":"action-recognition-in-videos-on-ird","dataset":"IRD","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"OHA-GCN (Two stream; HP + OHP-hands + informative samples)","paper_title":"Skeleton-based Action Recognition of People Handling Objects","paper_url":"/paper/skeleton-based-action-recognition-of-people","paper_date":"2019-01-21","arxiv_id":"1901.06882","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-minisports","slug":"action-recognition-in-videos-on-minisports","dataset":"miniSports","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"IF+MD+RGB-R (ResNet-18)","paper_title":"SCSampler: Sampling Salient Clips from Video for Efficient Action Recognition","paper_url":"/paper/scsampler-sampling-salient-clips-from-video","paper_date":"2019-04-08","arxiv_id":"1904.04289","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-ucf-101","slug":"action-recognition-in-videos-on-ucf-101","dataset":"UCF-101","dataset_url":"/dataset/ucf101","rows_in_archive":2,"metrics":["3-fold Accuracy","Accuracy"],"first_row_in_archive_order":{"model":"DMC-Net (ResNet-18)","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","paper_url":"/paper/dmc-net-generating-discriminative-motion-cues","paper_date":"2019-01-11","arxiv_id":"1901.03460","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-drone-action","slug":"action-recognition-on-drone-action","dataset":"Drone-Action","dataset_url":"/dataset/drone-action","rows_in_archive":2,"metrics":["Top 1 Accuracy","Top-1 Accuracy"],"first_row_in_archive_order":{"model":"FAR","paper_title":"FAR: Fourier Aerial Video Recognition","paper_url":"/paper/fourier-disentangled-space-time-attention-for","paper_date":"2022-03-21","arxiv_id":"2203.10694","code_links":[{"title":"divyakraman/ECCV2022_FARFourierAerialVideoRecognition","url":"https://github.com/divyakraman/ECCV2022_FARFourierAerialVideoRecognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-mimetics","slug":"action-recognition-on-mimetics","dataset":"Mimetics","dataset_url":"/dataset/mimetics","rows_in_archive":2,"metrics":["mAP"],"first_row_in_archive_order":{"model":"JMRN","paper_title":"Pose And Joint-Aware Action Recognition","paper_url":"/paper/pose-and-joint-aware-action-recognition","paper_date":"2020-10-16","arxiv_id":"2010.08164","code_links":[{"title":"anshulbshah/PoseAction","url":"https://github.com/anshulbshah/PoseAction"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-okutama-action","slug":"action-recognition-on-okutama-action","dataset":"Okutama-Action","dataset_url":"/dataset/okutama-action","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PLAR with bbox (Ours)","paper_title":"SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition","paper_url":"/paper/prompt-learning-for-action-recognition","paper_date":"2023-05-21","arxiv_id":"2305.12437","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-penn-action","slug":"action-recognition-on-penn-action","dataset":"Penn Action","dataset_url":"/dataset/penn-action","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"3DA (RGB + Pose)","paper_title":"Cross-Modal Learning with 3D Deformable Attention for Action Recognition","paper_url":"/paper/cross-modal-learning-with-3d-deformable","paper_date":"2022-12-12","arxiv_id":"2212.05638","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-sl-animals","slug":"action-recognition-on-sl-animals","dataset":"SL-Animals","dataset_url":null,"rows_in_archive":2,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"SEW-Resnet18 (3sets)","paper_title":"EventRPG: Event Data Augmentation with Relevance Propagation Guidance","paper_url":"/paper/eventrpg-event-data-augmentation-with","paper_date":"2024-03-14","arxiv_id":"2403.09274","code_links":[{"title":"myuansun/eventrpg","url":"https://github.com/myuansun/eventrpg"}],"syntology":{"n":16,"n_ran":5,"n_unverified":11,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-in-videos-on-actionnet-ve","slug":"action-recognition-in-videos-on-actionnet-ve","dataset":"ActionNet-VE","dataset_url":null,"rows_in_archive":1,"metrics":["F-measure (%)"],"first_row_in_archive_order":{"model":"Baseline","paper_title":"Extensible Hierarchical Method of Detecting Interactive Actions for Video Understanding","paper_url":"/paper/extensible-hierarchical-method-of-detecting","paper_date":"2017-08-11","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-charades","slug":"action-recognition-in-videos-on-charades","dataset":"Charades","dataset_url":"/dataset/charades","rows_in_archive":1,"metrics":["MAP"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-egogesture","slug":"action-recognition-in-videos-on-egogesture","dataset":"EgoGesture","dataset_url":"/dataset/egogesture","rows_in_archive":1,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"TSM+W3","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","paper_url":"/paper/knowing-what-where-and-when-to-look-efficient","paper_date":"2020-04-02","arxiv_id":"2004.01278","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-epic-kitchens","slug":"action-recognition-in-videos-on-epic-kitchens","dataset":"EPIC-KITCHENS-55","dataset_url":"/dataset/epic-kitchens","rows_in_archive":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"TSM+W3 - full res","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","paper_url":"/paper/knowing-what-where-and-when-to-look-efficient","paper_date":"2020-04-02","arxiv_id":"2004.01278","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-hmdb51","slug":"action-recognition-in-videos-on-hmdb51","dataset":"HMDB51","dataset_url":"/dataset/hmdb51","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-utd-mhad","slug":"action-recognition-in-videos-on-utd-mhad","dataset":"UTD-MHAD","dataset_url":"/dataset/utd-mhad","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Action Machine (RGB only)","paper_title":"Action Machine: Rethinking Action Recognition in Trimmed Videos","paper_url":"/paper/action-machine-rethinking-action-recognition","paper_date":"2018-12-14","arxiv_id":"1812.05770","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-in-videos-on-virat-ground","slug":"action-recognition-in-videos-on-virat-ground","dataset":"VIRAT Ground 2.0","dataset_url":null,"rows_in_archive":1,"metrics":["Average Accuracy"],"first_row_in_archive_order":{"model":"DHCM","paper_title":"A Hierarchical Context Model for Event Recognition in Surveillance Video","paper_url":"/paper/a-hierarchical-context-model-for-event-1","paper_date":"2014-06-27","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-dvs128-gesture","slug":"action-recognition-on-dvs128-gesture","dataset":"DVS128 Gesture","dataset_url":"/dataset/dvs128-gesture-dataset","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"SEW-Resnet18","paper_title":"EventRPG: Event Data Augmentation with Relevance Propagation Guidance","paper_url":"/paper/eventrpg-event-data-augmentation-with","paper_date":"2024-03-14","arxiv_id":"2403.09274","code_links":[{"title":"myuansun/eventrpg","url":"https://github.com/myuansun/eventrpg"}],"syntology":{"n":16,"n_ran":5,"n_unverified":11,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-on-hockey","slug":"action-recognition-on-hockey","dataset":"Hockey","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-industreal","slug":"action-recognition-on-industreal","dataset":"IndustReal","dataset_url":"/dataset/industreal","rows_in_archive":1,"metrics":["Top-1","Top-5"],"first_row_in_archive_order":{"model":"MViT-V2","paper_title":"IndustReal: A Dataset for Procedure Step Recognition Handling Execution Errors in Egocentric Videos in an Industrial-Like Setting","paper_url":"/paper/industreal-a-dataset-for-procedure-step","paper_date":"2023-10-26","arxiv_id":"2310.17323","code_links":[{"title":"timschoonbeek/industreal","url":"https://github.com/timschoonbeek/industreal"}],"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/action-recognition-on-kth","slug":"action-recognition-on-kth","dataset":"KTH","dataset_url":"/dataset/kth","rows_in_archive":1,"metrics":["16:9 Accuracy"],"first_row_in_archive_order":{"model":"CNN-GRU","paper_title":"Temporal Relations of Informative Frames in Action Recognition","paper_url":"/paper/temporal-relations-of-informative-frames-in","paper_date":"2024-03-06","arxiv_id":null,"code_links":[{"title":"Alirezarahnamaa/Temporal-Relations-of-Informative-Frames-in-Action-Recognition","url":"https://github.com/Alirezarahnamaa/Temporal-Relations-of-Informative-Frames-in-Action-Recognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-meccano","slug":"action-recognition-on-meccano","dataset":"MECCANO","dataset_url":"/dataset/meccano","rows_in_archive":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"SlowFast","paper_title":"The MECCANO Dataset: Understanding Human-Object Interactions from Egocentric Videos in an Industrial-like Domain","paper_url":"/paper/the-meccano-dataset-understanding-human","paper_date":"2020-10-12","arxiv_id":"2010.05654","code_links":[{"title":"fpv-iplab/MECCANO","url":"https://github.com/fpv-iplab/MECCANO"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-mtl-aqa","slug":"action-recognition-on-mtl-aqa","dataset":"MTL-AQA","dataset_url":"/dataset/mtl-aqa","rows_in_archive":1,"metrics":["Position Accuracy","Armstand Accuracy","Rotation Type Accuracy","No. of Somersaults Accuracy","No. of Twists Accuracy"],"first_row_in_archive_order":{"model":"C3D-AVG","paper_title":"What and How Well You Performed? A Multitask Learning Approach to Action Quality Assessment","paper_url":"/paper/what-and-how-well-you-performed-a-multitask","paper_date":"2019-04-08","arxiv_id":"1904.04346","code_links":[{"title":"ParitoshParmar/MTL-AQA","url":"https://github.com/ParitoshParmar/MTL-AQA"},{"title":"nzl-thu/musdl","url":"https://github.com/nzl-thu/musdl"},{"title":"luciferbobo/dae-aqa","url":"https://github.com/luciferbobo/dae-aqa"},{"title":"InfoX-SEU/DAE-AQA","url":"https://github.com/InfoX-SEU/DAE-AQA"},{"title":"InfoX-SEU/DAE_AQA","url":"https://github.com/InfoX-SEU/DAE_AQA"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-n-ucla","slug":"action-recognition-on-n-ucla","dataset":"N-UCLA","dataset_url":"/dataset/n-ucla","rows_in_archive":1,"metrics":["Accuracy (Cross-Subject)","Accuracy (Cross-View)"],"first_row_in_archive_order":{"model":"DVANet","paper_title":"DVANet: Disentangling View and Action Features for Multi-View Action Recognition","paper_url":"/paper/dvanet-disentangling-view-and-action-features","paper_date":"2023-12-10","arxiv_id":"2312.05719","code_links":[{"title":"NyleSiddiqui/MultiView_Actions","url":"https://github.com/NyleSiddiqui/MultiView_Actions"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-nec-drone","slug":"action-recognition-on-nec-drone","dataset":"NEC Drone","dataset_url":null,"rows_in_archive":1,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"FAR","paper_title":"FAR: Fourier Aerial Video Recognition","paper_url":"/paper/fourier-disentangled-space-time-attention-for","paper_date":"2022-03-21","arxiv_id":"2203.10694","code_links":[{"title":"divyakraman/ECCV2022_FARFourierAerialVideoRecognition","url":"https://github.com/divyakraman/ECCV2022_FARFourierAerialVideoRecognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-rocog-v2","slug":"action-recognition-on-rocog-v2","dataset":"RoCoG-v2","dataset_url":"/dataset/rocog-v2","rows_in_archive":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"AZTR (Ours)","paper_title":"AZTR: Aerial Video Action Recognition with Auto Zoom and Temporal Reasoning","paper_url":"/paper/aztr-aerial-video-action-recognition-with","paper_date":"2023-03-02","arxiv_id":"2303.01589","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-skeleton-mimetics","slug":"action-recognition-on-skeleton-mimetics","dataset":"Skeleton-Mimetics","dataset_url":"/dataset/skeleton-mimetics","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Structured Keypoint Pooling","paper_title":"Unified Keypoint-based Action Recognition Framework via Structured Keypoint Pooling","paper_url":"/paper/unified-keypoint-based-action-recognition","paper_date":"2023-03-27","arxiv_id":"2303.15270","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-thumos14","slug":"action-recognition-on-thumos14","dataset":"THUMOS14","dataset_url":"/dataset/thumos14-1","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MSQNet","paper_title":"Actor-agnostic Multi-label Action Recognition with Multi-modal Query","paper_url":"/paper/msqnet-actor-agnostic-action-recognition-with","paper_date":"2023-07-20","arxiv_id":"2307.10763","code_links":[{"title":"mondalanindya/msqnet","url":"https://github.com/mondalanindya/msqnet"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-uav-human-1","slug":"action-recognition-on-uav-human-1","dataset":"UAV Human","dataset_url":null,"rows_in_archive":1,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"FAR","paper_title":"FAR: Fourier Aerial Video Recognition","paper_url":"/paper/fourier-disentangled-space-time-attention-for","paper_date":"2022-03-21","arxiv_id":"2203.10694","code_links":[{"title":"divyakraman/ECCV2022_FARFourierAerialVideoRecognition","url":"https://github.com/divyakraman/ECCV2022_FARFourierAerialVideoRecognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-ucf-101","slug":"action-recognition-on-ucf-101","dataset":"UCF 101","dataset_url":"/dataset/ucf101","rows_in_archive":1,"metrics":["3-fold Accuracy"],"first_row_in_archive_order":{"model":"R2+1D-BERT","paper_title":"Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition","paper_url":"/paper/late-temporal-modeling-in-3d-cnn","paper_date":"2020-08-03","arxiv_id":"2008.01232","code_links":[{"title":"artest08/LateTemporalModeling3DCNN","url":"https://github.com/artest08/LateTemporalModeling3DCNN"},{"title":"kietngt00/hmdb51-recognition","url":"https://github.com/kietngt00/hmdb51-recognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-ucfsports","slug":"action-recognition-on-ucfsports","dataset":"UCFSports","dataset_url":null,"rows_in_archive":1,"metrics":["leave one out cross validation(LOOCV)"],"first_row_in_archive_order":{"model":"CNN-LSTM","paper_title":"Temporal Relations of Informative Frames in Action Recognition","paper_url":"/paper/temporal-relations-of-informative-frames-in","paper_date":"2024-03-06","arxiv_id":null,"code_links":[{"title":"Alirezarahnamaa/Temporal-Relations-of-Informative-Frames-in-Action-Recognition","url":"https://github.com/Alirezarahnamaa/Temporal-Relations-of-Informative-Frames-in-Action-Recognition"}],"syntology":null}},{"leaderboard":"/sota/action-recognition-on-win-fail-action","slug":"action-recognition-on-win-fail-action","dataset":"Win-Fail Action Understanding","dataset_url":"/dataset/win-fail-action-understanding","rows_in_archive":1,"metrics":["2-Class Accuracy"],"first_row_in_archive_order":{"model":"2DCNN+TRN","paper_title":"Win-Fail Action Recognition","paper_url":"/paper/win-fail-action-recognition","paper_date":"2021-02-15","arxiv_id":"2102.07355","code_links":[{"title":"ParitoshParmar/Win-Fail-Action-Recognition","url":"https://github.com/ParitoshParmar/Win-Fail-Action-Recognition"}],"syntology":null}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/hmdb51","name":"HMDB51","full_name":"","num_papers_in_archive":839},{"url":"/dataset/activitynet","name":"ActivityNet","full_name":"","num_papers_in_archive":807},{"url":"/dataset/ntu-rgb-d","name":"NTU RGB+D","full_name":"","num_papers_in_archive":476},{"url":"/dataset/charades","name":"Charades","full_name":"","num_papers_in_archive":428},{"url":"/dataset/thumos14-1","name":"THUMOS14","full_name":"","num_papers_in_archive":318},{"url":"/dataset/something-something-v2","name":"Something-Something V2","full_name":"","num_papers_in_archive":290},{"url":"/dataset/howto100m","name":"HowTo100M","full_name":"HowTo100M","num_papers_in_archive":286},{"url":"/dataset/kth","name":"KTH","full_name":"KTH Action dataset","num_papers_in_archive":279},{"url":"/dataset/sports-1m","name":"Sports-1M","full_name":"","num_papers_in_archive":164},{"url":"/dataset/epic-kitchens-100","name":"EPIC-KITCHENS-100","full_name":"","num_papers_in_archive":162},{"url":"/dataset/ntu-rgb-d-120","name":"NTU RGB+D 120","full_name":"","num_papers_in_archive":137},{"url":"/dataset/something-something-v1","name":"Something-Something V1","full_name":"","num_papers_in_archive":117},{"url":"/dataset/ava","name":"AVA","full_name":"Atomic Visual Actions","num_papers_in_archive":113},{"url":"/dataset/penn-action","name":"Penn Action","full_name":"","num_papers_in_archive":110},{"url":"/dataset/coin","name":"COIN","full_name":"","num_papers_in_archive":105},{"url":"/dataset/dvs128-gesture-dataset","name":"DVS128 Gesture","full_name":"","num_papers_in_archive":103},{"url":"/dataset/kinetics-700","name":"Kinetics-700","full_name":"Kinetics-700","num_papers_in_archive":95},{"url":"/dataset/volleyball","name":"Volleyball","full_name":"","num_papers_in_archive":80},{"url":"/dataset/finegym","name":"FineGym","full_name":"FineGym","num_papers_in_archive":76},{"url":"/dataset/hacs","name":"HACS","full_name":"Human Action Clips and Segments","num_papers_in_archive":75},{"url":"/dataset/babel-1","name":"BABEL","full_name":"","num_papers_in_archive":72},{"url":"/dataset/utd-mhad","name":"UTD-MHAD","full_name":"","num_papers_in_archive":62},{"url":"/dataset/multithumos","name":"MultiTHUMOS","full_name":"","num_papers_in_archive":58},{"url":"/dataset/assembly101","name":"Assembly101","full_name":"","num_papers_in_archive":57},{"url":"/dataset/cater","name":"CATER","full_name":"","num_papers_in_archive":51},{"url":"/dataset/uav-human","name":"UAV-Human","full_name":"","num_papers_in_archive":47},{"url":"/dataset/epic-kitchens","name":"EPIC-KITCHENS-55","full_name":"","num_papers_in_archive":42},{"url":"/dataset/emotic","name":"EMOTIC","full_name":"EMOTIons in Context","num_papers_in_archive":38},{"url":"/dataset/egogesture","name":"EgoGesture","full_name":"","num_papers_in_archive":37},{"url":"/dataset/egohands","name":"EgoHands","full_name":"","num_papers_in_archive":34},{"url":"/dataset/charades-ego","name":"Charades-Ego","full_name":"","num_papers_in_archive":33},{"url":"/dataset/mtl-aqa","name":"MTL-AQA","full_name":"","num_papers_in_archive":33},{"url":"/dataset/cholect50","name":"CholecT50","full_name":"Cholecystectomy Action Triplet","num_papers_in_archive":32},{"url":"/dataset/n-ucla","name":"N-UCLA","full_name":"Northwestern-UCLA Multiview Action 3D Dataset","num_papers_in_archive":30},{"url":"/dataset/animal-kingdom","name":"Animal Kingdom","full_name":"","num_papers_in_archive":26},{"url":"/dataset/drive-act","name":"Drive&Act","full_name":"","num_papers_in_archive":26},{"url":"/dataset/okutama-action","name":"Okutama-Action","full_name":"","num_papers_in_archive":24},{"url":"/dataset/mmact","name":"MMAct","full_name":"","num_papers_in_archive":23},{"url":"/dataset/bar","name":"BAR","full_name":"Biased Action Recognition","num_papers_in_archive":22},{"url":"/dataset/multisports","name":"MultiSports","full_name":"","num_papers_in_archive":20},{"url":"/dataset/meccano","name":"MECCANO","full_name":"","num_papers_in_archive":19},{"url":"/dataset/florence3d","name":"Florence3D","full_name":"","num_papers_in_archive":18},{"url":"/dataset/icvl","name":"ICVL","full_name":null,"num_papers_in_archive":17},{"url":"/dataset/cholect45","name":"CholecT45","full_name":"CholecT45","num_papers_in_archive":16},{"url":"/dataset/hvu","name":"HVU","full_name":"Holistic Video Understanding","num_papers_in_archive":16},{"url":"/dataset/jester-gesture-recognition","name":"Jester (Gesture Recognition)","full_name":"","num_papers_in_archive":16},{"url":"/dataset/rwf-2000","name":"RWF-2000","full_name":"","num_papers_in_archive":16},{"url":"/dataset/h2o-dataset","name":"H2O  (2 Hands and Objects)","full_name":"","num_papers_in_archive":14},{"url":"/dataset/haa500","name":"HAA500","full_name":"Human-Centric Atomic Action Dataset","num_papers_in_archive":14},{"url":"/dataset/watch-n-patch","name":"Watch-n-Patch","full_name":"Watch-n-Patch","num_papers_in_archive":13},{"url":"/dataset/yup","name":"YUP++","full_name":"YUP++ Dynamic Scenes dataset","num_papers_in_archive":13},{"url":"/dataset/egoexolearn","name":"EgoExoLearn","full_name":"","num_papers_in_archive":12},{"url":"/dataset/epic-sounds","name":"EPIC-SOUNDS","full_name":"","num_papers_in_archive":12},{"url":"/dataset/rareact","name":"RareAct","full_name":null,"num_papers_in_archive":12},{"url":"/dataset/mimetics","name":"Mimetics","full_name":"","num_papers_in_archive":11},{"url":"/dataset/2024-ai-city-challenge-mtmc-people-tracking","name":"2024 AI City Challenge","full_name":"","num_papers_in_archive":10},{"url":"/dataset/tapos","name":"TAPOS","full_name":"TAPOS","num_papers_in_archive":10},{"url":"/dataset/home-action-genome","name":"Home Action Genome","full_name":"","num_papers_in_archive":9},{"url":"/dataset/kinetics-700-2020","name":"Kinetics-700-2020","full_name":"","num_papers_in_archive":9},{"url":"/dataset/psi-ava","name":"PSI-AVA","full_name":"","num_papers_in_archive":9},{"url":"/dataset/msr-actionpairs","name":"MSR ActionPairs","full_name":"","num_papers_in_archive":7},{"url":"/dataset/pa-hmdb51","name":"PA-HMDB51","full_name":"Privacy Annotated HMDB51","num_papers_in_archive":7},{"url":"/dataset/tum-kitchen","name":"TUM Kitchen","full_name":"TUM Kitchen","num_papers_in_archive":7},{"url":"/dataset/urfd-dataset","name":"URFD Dataset","full_name":"UR Fall Detection Dataset","num_papers_in_archive":7},{"url":"/dataset/action-recognition-in-the-dark","name":"Action Recognition in the Dark","full_name":"ARID","num_papers_in_archive":6},{"url":"/dataset/industreal","name":"IndustReal","full_name":"IndustReal Dataset of Egocentric Videos for Procedure Understanding","num_papers_in_archive":6},{"url":"/dataset/real-life-violence-situations-dataset","name":"Real Life Violence Situations Dataset","full_name":"","num_papers_in_archive":5},{"url":"/dataset/rocog-v2","name":"RoCoG-v2","full_name":"Robot Control Gestures","num_papers_in_archive":5},{"url":"/dataset/simitate","name":"Simitate","full_name":null,"num_papers_in_archive":5},{"url":"/dataset/uestc-rgb-d","name":"UESTC RGB-D","full_name":"UESTC RGB-D Varying-view action database","num_papers_in_archive":5},{"url":"/dataset/tinyvirat","name":"TinyVIRAT","full_name":"","num_papers_in_archive":4},{"url":"/dataset/verse","name":"Verse","full_name":"","num_papers_in_archive":4},{"url":"/dataset/chairs-dataset","name":"CHAIRS dataset","full_name":"","num_papers_in_archive":3},{"url":"/dataset/composable-activities-dataset","name":"Composable activities dataset","full_name":"","num_papers_in_archive":3},{"url":"/dataset/converse","name":"CONVERSE","full_name":"","num_papers_in_archive":3},{"url":"/dataset/dcase-2014","name":"DCASE 2014","full_name":"DCASE 2014","num_papers_in_archive":3},{"url":"/dataset/fitness-aqa","name":"Fitness-AQA","full_name":"Fitness Action Quality Assessment [ECCV 2022]","num_papers_in_archive":3},{"url":"/dataset/hollywood-3d-dataset","name":"Hollywood 3D dataset","full_name":"","num_papers_in_archive":3},{"url":"/dataset/vlogs","name":"IfAct","full_name":"Identifying Human Actions Visible in Online Vlogs","num_papers_in_archive":3},{"url":"/dataset/deep-future-gaze","name":"OST","full_name":"Egocentric Dataset","num_papers_in_archive":3},{"url":"/dataset/petraw","name":"PETRAW","full_name":"PEg TRAnsfer Workflow recognition by different modalities","num_papers_in_archive":3},{"url":"/dataset/uav-gesture","name":"UAV-GESTURE","full_name":"","num_papers_in_archive":3},{"url":"/dataset/uestc-mmea-cl","name":"UESTC-MMEA-CL","full_name":"A multi-modal egocentric activity dataset for continual learning","num_papers_in_archive":3},{"url":"/dataset/avmit","name":"AVMIT","full_name":"Audiovisual Moments in Time","num_papers_in_archive":2},{"url":"/dataset/cvb-a-video-dataset-of-cattle-visual","name":"CVB","full_name":"Video Dataset of Cattle Visual Behaviors","num_papers_in_archive":2},{"url":"/dataset/drone-action","name":"Drone-Action","full_name":"Drone-Action: An Outdoor Recorded Drone Video Dataset for Action Recognition","num_papers_in_archive":2},{"url":"/dataset/kinetics-sound","name":"Kinetics-Sound","full_name":"","num_papers_in_archive":2},{"url":"/dataset/lote-animal","name":"LoTE-Animal","full_name":"LoTE-Animal: A Long Time-span Dataset for Endangered Animal Behavior Understanding","num_papers_in_archive":2},{"url":"/dataset/mcad","name":"MCAD","full_name":"Multi-Camera Action Dataset","num_papers_in_archive":2},{"url":"/dataset/metavd","name":"MetaVD","full_name":"Meta Video Dataset","num_papers_in_archive":2},{"url":"/dataset/mphoi-72","name":"MPHOI-72","full_name":"Multi-person Human-object Interaction Dataset 72","num_papers_in_archive":2},{"url":"/dataset/rise","name":"RISE","full_name":null,"num_papers_in_archive":2},{"url":"/dataset/skeletics-152-1","name":"Skeletics 152","full_name":"","num_papers_in_archive":2},{"url":"/dataset/skeleton-mimetics","name":"Skeleton-Mimetics","full_name":"","num_papers_in_archive":2},{"url":"/dataset/wifall","name":"WiFall","full_name":"Wireless Sensing Dataset for Fall Detection, Action Recognition and People ID Identification with ESP32-S3","num_papers_in_archive":2},{"url":"/dataset/anubis","name":"ANUBIS","full_name":"Skeleton-Based Action Recognition Dataset","num_papers_in_archive":1},{"url":"/dataset/bear","name":"BEAR","full_name":"Benchmark on video Action Recognition","num_papers_in_archive":1},{"url":"/dataset/gj","name":"GJ","full_name":"gastrojejunostomy utsw","num_papers_in_archive":1},{"url":"/dataset/ha-vid","name":"HA-ViD","full_name":"HA-ViD: A Human Assembly Video Dataset","num_papers_in_archive":1},{"url":"/dataset/handwash-dataset","name":"Handwash Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/inhard","name":"InHARD","full_name":"Industrial Human Action Recognition Dataset in the Context of Industrial Collaborative Robotics","num_papers_in_archive":1},{"url":"/dataset/mentalhad","name":"MentalHAD","full_name":"","num_papers_in_archive":1},{"url":"/dataset/metaphorics","name":"Metaphorics","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mod20","name":"MOD20","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mouse-reach","name":"Mouse Reach","full_name":"","num_papers_in_archive":1},{"url":"/dataset/mpose2021","name":"MPOSE2021","full_name":"MPOSE2021 Dataset for Short-time Human Action Recognition","num_papers_in_archive":1},{"url":"/dataset/surveillance-camera-fight-dataset","name":"Surveillance Camera Fight Dataset","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/tinyvirat-v2","name":"TinyVIRAT-v2","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ucf-101-vipriors-subset","name":"UCF-101 VIPriors subset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/ucf101-ds","name":"UCF101-DS","full_name":"UCF101 Distribution Shift","num_papers_in_archive":1},{"url":"/dataset/vfd-2000","name":"VFD-2000","full_name":"","num_papers_in_archive":1},{"url":"/dataset/win-fail-action-understanding","name":"Win-Fail Action Understanding","full_name":"Win-Fail Action Understanding","num_papers_in_archive":1},{"url":"/dataset/vidimu-multimodal-video-and-imu-kinematic","name":"VIDIMU: Multimodal video and IMU kinematic dataset on daily life activities using affordable devices","full_name":"https://zenodo.org/record/8210563","num_papers_in_archive":0}],"subtasks":[{"url":"/task/3d-human-action-recognition","name":"3D Action Recognition"},{"url":"/task/action-recognition-in-still-images","name":"Action Recognition In Still Images"},{"url":"/task/action-recognition-in-videos-2","name":"Action Recognition In Videos"},{"url":"/task/action-triplet-recognition","name":"Action Triplet Recognition"},{"url":"/task/animal-action-recognition","name":"Animal Action Recognition"},{"url":"/task/atomic-action-recognition","name":"Atomic action recognition"},{"url":"/task/few-shot-action-recognition","name":"Few Shot Action Recognition"},{"url":"/task/fine-grained-action-recognition","name":"Fine-grained Action Recognition"},{"url":"/task/micro-action-recognition","name":"Micro-Action Recognition"},{"url":"/task/open-set-action-recognition","name":"Open Set Action Recognition"},{"url":"/task/open-vocabulary-action-recognition","name":"Open Vocabulary Action Recognition"},{"url":"/task/self-supervised-action-recognition","name":"Self-Supervised Action Recognition"},{"url":"/task/self-supervised-human-action-recognition","name":"Self-Supervised Human Action Recognition"},{"url":"/task/transportation-mode-detection","name":"Transportation Mode Detection"},{"url":"/task/weakly-supervised-action-recognition","name":"Weakly-Supervised Action Recognition"}],"parent_tasks":[{"url":"/task/activity-recognition","name":"Activity Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":1058,"tagged_in_all":2759,"items":[{"url":"/paper/efficientnet-rethinking-model-scaling-for","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","date":"2019-05-28","arxiv_id":"1905.11946","repositories_listed":144,"syntology":{"n":302,"n_ran":171,"n_unverified":131,"n_pointer_only":112}},{"url":"/paper/learning-transferable-visual-models-from","title":"Learning Transferable Visual Models From Natural Language Supervision","date":"2021-02-26","arxiv_id":"2103.00020","repositories_listed":82,"syntology":{"n":20,"n_ran":16,"n_unverified":4,"n_pointer_only":16}},{"url":"/paper/quo-vadis-action-recognition-a-new-model-and","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","date":"2017-05-22","arxiv_id":"1705.07750","repositories_listed":34,"syntology":{"n":28,"n_ran":16,"n_unverified":12,"n_pointer_only":7}},{"url":"/paper/non-local-neural-networks","title":"Non-local Neural Networks","date":"2017-11-21","arxiv_id":"1711.07971","repositories_listed":32,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/learning-spatiotemporal-features-with-3d","title":"Learning Spatiotemporal Features with 3D Convolutional Networks","date":"2014-12-02","arxiv_id":"1412.0767","repositories_listed":29,"syntology":null},{"url":"/paper/can-spatiotemporal-3d-cnns-retrace-the","title":"Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet?","date":"2017-11-27","arxiv_id":"1711.09577","repositories_listed":26,"syntology":{"n":8,"n_ran":7,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/spatial-temporal-graph-convolutional-networks-1","title":"Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition","date":"2018-01-23","arxiv_id":"1801.07455","repositories_listed":24,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","arxiv_id":"1711.11248","repositories_listed":24,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/grad-cam-improved-visual-explanations-for","title":"Grad-CAM++: Improved Visual Explanations for Deep Convolutional Networks","date":"2017-10-30","arxiv_id":"1710.11063","repositories_listed":24,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":3}},{"url":"/paper/cider-consensus-based-image-description","title":"CIDEr: Consensus-based Image Description Evaluation","date":"2014-11-20","arxiv_id":"1411.5726","repositories_listed":24,"syntology":{"n":32,"n_ran":12,"n_unverified":20,"n_pointer_only":27}},{"url":"/paper/temporal-segment-networks-towards-good","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","date":"2016-08-02","arxiv_id":"1608.00859","repositories_listed":22,"syntology":{"n":24,"n_ran":2,"n_unverified":22,"n_pointer_only":3}},{"url":"/paper/is-space-time-attention-all-you-need-for","title":"Is Space-Time Attention All You Need for Video Understanding?","date":"2021-02-09","arxiv_id":"2102.05095","repositories_listed":16,"syntology":{"n":43,"n_ran":35,"n_unverified":8,"n_pointer_only":14}},{"url":"/paper/video-swin-transformer","title":"Video Swin Transformer","date":"2021-06-24","arxiv_id":"2106.13230","repositories_listed":15,"syntology":{"n":32,"n_ran":7,"n_unverified":25,"n_pointer_only":0}},{"url":"/paper/bmn-boundary-matching-network-for-temporal","title":"BMN: Boundary-Matching Network for Temporal Action Proposal Generation","date":"2019-07-23","arxiv_id":"1907.09702","repositories_listed":15,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/slowfast-networks-for-video-recognition","title":"SlowFast Networks for Video Recognition","date":"2018-12-10","arxiv_id":"1812.03982","repositories_listed":15,"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/temporal-shift-module-for-efficient-video","title":"TSM: Temporal Shift Module for Efficient Video Understanding","date":"2018-11-20","arxiv_id":"1811.08383","repositories_listed":13,"syntology":{"n":16,"n_ran":6,"n_unverified":10,"n_pointer_only":4}},{"url":"/paper/unsupervised-learning-of-video","title":"Unsupervised Learning of Video Representations using LSTMs","date":"2015-02-16","arxiv_id":"1502.04681","repositories_listed":12,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/temporal-segment-networks-for-action","title":"Temporal Segment Networks for Action Recognition in Videos","date":"2017-05-08","arxiv_id":"1705.02953","repositories_listed":11,"syntology":null},{"url":"/paper/2103-15691","title":"ViViT: A Video Vision Transformer","date":"2021-03-29","arxiv_id":"2103.15691","repositories_listed":10,"syntology":{"n":21,"n_ran":14,"n_unverified":7,"n_pointer_only":1}},{"url":"/paper/videomae-masked-autoencoders-are-data-1","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","date":"2022-03-23","arxiv_id":"2203.12602","repositories_listed":9,"syntology":{"n":13,"n_ran":9,"n_unverified":4,"n_pointer_only":12}},{"url":"/paper/improved-multiscale-vision-transformers-for","title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","date":"2021-12-02","arxiv_id":"2112.01526","repositories_listed":9,"syntology":null},{"url":"/paper/graph-based-global-reasoning-networks","title":"Graph-Based Global Reasoning Networks","date":"2018-11-30","arxiv_id":"1811.12814","repositories_listed":9,"syntology":{"n":15,"n_ran":8,"n_unverified":7,"n_pointer_only":4}},{"url":"/paper/ava-a-video-dataset-of-spatio-temporally","title":"AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions","date":"2017-05-23","arxiv_id":"1705.08421","repositories_listed":9,"syntology":null},{"url":"/paper/multiscale-vision-transformers","title":"Multiscale Vision Transformers","date":"2021-04-22","arxiv_id":"2104.11227","repositories_listed":8,"syntology":{"n":26,"n_ran":13,"n_unverified":13,"n_pointer_only":5}},{"url":"/paper/refining-activation-downsampling-with","title":"Refining activation downsampling with SoftPool","date":"2021-01-02","arxiv_id":"2101.00440","repositories_listed":8,"syntology":null},{"url":"/paper/stnet-local-and-global-spatial-temporal","title":"StNet: Local and Global Spatial-Temporal Modeling for Action Recognition","date":"2018-11-05","arxiv_id":"1811.01549","repositories_listed":8,"syntology":null},{"url":"/paper/rescaling-egocentric-vision","title":"Rescaling Egocentric Vision","date":"2020-06-23","arxiv_id":"2006.13256","repositories_listed":7,"syntology":{"n":18,"n_ran":3,"n_unverified":15,"n_pointer_only":0}},{"url":"/paper/video-classification-with-channel-separated","title":"Video Classification with Channel-Separated Convolutional Networks","date":"2019-04-04","arxiv_id":"1904.02811","repositories_listed":7,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/multivariate-lstm-fcns-for-time-series","title":"Multivariate LSTM-FCNs for Time Series Classification","date":"2018-01-14","arxiv_id":"1801.04503","repositories_listed":7,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":2}},{"url":"/paper/youtube-8m-a-large-scale-video-classification","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","date":"2016-09-27","arxiv_id":"1609.08675","repositories_listed":7,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":0}}],"syntology_records":24,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":2,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}