{"url":"/task/action-classification","name":"Action Classification","slug":"action-classification","description_markdown":"Image source: [The Kinetics Human Action Video Dataset](https://arxiv.org/pdf/1705.06950.pdf)","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":457,"papers_with_code":251,"benchmarks":28,"benchmark_tables_in_archive":28,"benchmark_tables_shown":28,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":33,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/action-classification-on-kinetics-400","slug":"action-classification-on-kinetics-400","dataset":"Kinetics-400","dataset_url":"/dataset/kinetics","rows_in_archive":207,"metrics":["Acc@1","Acc@5","FLOPs (G) x views","Clip acc@1","Parameters (M)","Clip acc@5"],"first_row_in_archive_order":{"model":"OmniVec2","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_url":"/paper/omnivec2-a-novel-transformer-based-network","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-kinetics-600","slug":"action-classification-on-kinetics-600","dataset":"Kinetics-600","dataset_url":"/dataset/kinetics-600","rows_in_archive":65,"metrics":["Top-1 Accuracy","Top-5 Accuracy","GFLOPs"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-charades","slug":"action-classification-on-charades","dataset":"Charades","dataset_url":"/dataset/charades","rows_in_archive":49,"metrics":["MAP","FLOPs (G) x views"],"first_row_in_archive_order":{"model":"TokenLearner","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","paper_url":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_date":"2021-06-21","arxiv_id":"2106.11297","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/token_learner.py"},{"title":"rish-16/tokenlearner-pytorch","url":"https://github.com/rish-16/tokenlearner-pytorch"},{"title":"ariG23498/TokenLearner","url":"https://github.com/ariG23498/TokenLearner"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/7/token_learner"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/4/token_learner"},{"title":"MindSpore-scientific/code-11","url":"https://github.com/MindSpore-scientific/code-11/tree/main/token_learner"},{"title":"MindSpore-scientific/code-1","url":"https://github.com/MindSpore-scientific/code-1/tree/main/token_learner"},{"title":"MindSpore-scientific/code-8","url":"https://github.com/MindSpore-scientific/code-8/tree/main/token_learner"},{"title":"MindSpore-scientific/code-10","url":"https://github.com/MindSpore-scientific/code-10/tree/main/token_learner"},{"title":"MindSpore-scientific-2/code-8","url":"https://github.com/MindSpore-scientific-2/code-8/tree/main/token_learner"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/action-classification-on-kinetics-700","slug":"action-classification-on-kinetics-700","dataset":"Kinetics-700","dataset_url":"/dataset/kinetics-700","rows_in_archive":36,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-moments-in-time","slug":"action-classification-on-moments-in-time","dataset":"MiT","dataset_url":null,"rows_in_archive":29,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"OmniVec2","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_url":"/paper/omnivec2-a-novel-transformer-based-network","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-toyota-smarthome","slug":"action-classification-on-toyota-smarthome","dataset":"Toyota Smarthome dataset","dataset_url":"/dataset/toyota-smarthome","rows_in_archive":13,"metrics":["CS","CV1","CV2","Accuracy"],"first_row_in_archive_order":{"model":"π-ViT","paper_title":"Just Add $π$! Pose Induced Video Transformers for Understanding Activities of Daily Living","paper_url":"/paper/just-add-p-pose-induced-video-transformers","paper_date":"2023-11-30","arxiv_id":"2311.18840","code_links":[{"title":"dominickrei/pi-vit","url":"https://github.com/dominickrei/pi-vit"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-avid","slug":"action-classification-on-avid","dataset":"AViD","dataset_url":"/dataset/avid","rows_in_archive":10,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"TokenLearner","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","paper_url":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_date":"2021-06-21","arxiv_id":"2106.11297","code_links":[{"title":"google-research/scenic","url":"https://github.com/google-research/scenic"},{"title":"keras-team/keras-io","url":"https://github.com/keras-team/keras-io/blob/master/examples/vision/token_learner.py"},{"title":"rish-16/tokenlearner-pytorch","url":"https://github.com/rish-16/tokenlearner-pytorch"},{"title":"ariG23498/TokenLearner","url":"https://github.com/ariG23498/TokenLearner"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/7/token_learner"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/4/token_learner"},{"title":"MindSpore-scientific/code-11","url":"https://github.com/MindSpore-scientific/code-11/tree/main/token_learner"},{"title":"MindSpore-scientific/code-1","url":"https://github.com/MindSpore-scientific/code-1/tree/main/token_learner"},{"title":"MindSpore-scientific/code-8","url":"https://github.com/MindSpore-scientific/code-8/tree/main/token_learner"},{"title":"MindSpore-scientific/code-10","url":"https://github.com/MindSpore-scientific/code-10/tree/main/token_learner"},{"title":"MindSpore-scientific-2/code-8","url":"https://github.com/MindSpore-scientific-2/code-8/tree/main/token_learner"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/action-classification-on-kinetics-sounds","slug":"action-classification-on-kinetics-sounds","dataset":"Kinetics-Sounds","dataset_url":"/dataset/kinetics","rows_in_archive":4,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"CA2ST(B/16)","paper_title":"CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition","paper_url":"/paper/ca-2st-cross-attention-in-audio-space-and","paper_date":"2025-03-30","arxiv_id":"2503.23447","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-moments-in-time-2","slug":"action-classification-on-moments-in-time-2","dataset":"Moments in Time","dataset_url":null,"rows_in_archive":4,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"OmniVec2","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_url":"/paper/omnivec2-a-novel-transformer-based-network","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-activitynet-12","slug":"action-classification-on-activitynet-12","dataset":"ActivityNet-1.2","dataset_url":"/dataset/activitynet","rows_in_archive":3,"metrics":["mAP"],"first_row_in_archive_order":{"model":"W-TALC","paper_title":"W-TALC: Weakly-supervised Temporal Activity Localization and Classification","paper_url":"/paper/w-talc-weakly-supervised-temporal-activity","paper_date":"2018-07-27","arxiv_id":"1807.10418","code_links":[{"title":"sujoyp/wtalc-pytorch","url":"https://github.com/sujoyp/wtalc-pytorch"}],"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}}},{"leaderboard":"/sota/action-classification-on-kinetics-700-2020","slug":"action-classification-on-kinetics-700-2020","dataset":"Kinetics-700-2020","dataset_url":"/dataset/kinetics-700-2020","rows_in_archive":3,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"ALIP-ViT B/32 LAION30M","paper_title":"ALIP: Adaptive Language-Image Pre-training with Synthetic Caption","paper_url":"/paper/alip-adaptive-language-image-pre-training","paper_date":"2023-08-16","arxiv_id":"2308.08428","code_links":[{"title":"deepglint/alip","url":"https://github.com/deepglint/alip"}],"syntology":{"n":10,"n_ran":5,"n_unverified":5,"n_pointer_only":10}}},{"leaderboard":"/sota/action-classification-on-thumos14","slug":"action-classification-on-thumos14","dataset":"THUMOS’14","dataset_url":"/dataset/thumos14-1","rows_in_archive":3,"metrics":["mAP"],"first_row_in_archive_order":{"model":"3C-Net","paper_title":"3C-Net: Category Count and Center Loss for Weakly-Supervised Action Localization","paper_url":"/paper/3c-net-category-count-and-center-loss-for","paper_date":"2019-08-22","arxiv_id":"1908.08216","code_links":[{"title":"naraysa/3c-net","url":"https://github.com/naraysa/3c-net"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-wigesture","slug":"action-classification-on-wigesture","dataset":"WiGesture","dataset_url":"/dataset/wigesture","rows_in_archive":3,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"CSI-BERT2","paper_title":"Mining Limited Data Sufficiently: A BERT-inspired Approach for CSI Time Series Application in Wireless Communication and Sensing","paper_url":"/paper/mining-limited-data-sufficiently-a-bert","paper_date":"2024-12-09","arxiv_id":"2412.06861","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-mit","slug":"action-classification-on-mit","dataset":"MIT","dataset_url":null,"rows_in_archive":2,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"InternVideo2-6B","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_url":"/paper/internvideo2-scaling-video-foundation-models","paper_date":"2024-03-22","arxiv_id":"2403.15377","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-ttstroke-21","slug":"action-classification-on-ttstroke-21","dataset":"TTStroke-21 ME22","dataset_url":"/dataset/ttstroke-21","rows_in_archive":2,"metrics":["Acc"],"first_row_in_archive_order":{"model":"RGB and PRGB","paper_title":"Fine-Grained Action Detection with RGB and Pose Information using Two Stream Convolutional Networks","paper_url":"/paper/fine-grained-action-detection-with-rgb-and","paper_date":"2023-02-06","arxiv_id":"2302.02755","code_links":[{"title":"fidsinn/sporttaskme22","url":"https://github.com/fidsinn/sporttaskme22"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-activitynet","slug":"action-classification-on-activitynet","dataset":"ActivityNet","dataset_url":"/dataset/activitynet","rows_in_archive":1,"metrics":["Top 1 Accuracy","Top 5 Accuracy"],"first_row_in_archive_order":{"model":"UniFormerV2-L","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","paper_url":"/paper/uniformerv2-spatiotemporal-learning-by-arming","paper_date":"2022-09-22","arxiv_id":null,"code_links":[{"title":"OpenGVLab/UniFormerV2","url":"https://github.com/OpenGVLab/UniFormerV2"},{"title":"innat/UniFormerV2","url":"https://github.com/innat/UniFormerV2"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-babel","slug":"action-classification-on-babel","dataset":"BABEL","dataset_url":"/dataset/babel-1","rows_in_archive":1,"metrics":["CE Top-1","CE Top-1-norm","CE Top-5"],"first_row_in_archive_order":{"model":"2s-AGCN","paper_title":"BABEL: Bodies, Action and Behavior with English Labels","paper_url":"/paper/babel-bodies-action-and-behavior-with-english","paper_date":"2021-06-17","arxiv_id":"2106.09696","code_links":[{"title":"abhinanda-punnakkal/BABEL","url":"https://github.com/abhinanda-punnakkal/BABEL"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-celebv-hq","slug":"action-classification-on-celebv-hq","dataset":"CelebV-HQ","dataset_url":"/dataset/celebv-hq","rows_in_archive":1,"metrics":["AUC","Accuracy"],"first_row_in_archive_order":{"model":"MARLIN","paper_title":"MARLIN: Masked Autoencoder for facial video Representation LearnINg","paper_url":"/paper/marlin-masked-autoencoder-for-facial-video","paper_date":"2022-11-12","arxiv_id":"2211.06627","code_links":[{"title":"ControlNet/MARLIN","url":"https://github.com/ControlNet/MARLIN"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-diving-48","slug":"action-classification-on-diving-48","dataset":"Diving-48","dataset_url":null,"rows_in_archive":1,"metrics":["Acc@1"],"first_row_in_archive_order":{"model":"DualPath w/ ViT-B/16","paper_title":"Dual-path Adaptation from Image to Video Transformers","paper_url":"/paper/dual-path-adaptation-from-image-to-video","paper_date":"2023-03-17","arxiv_id":"2303.09857","code_links":[{"title":"park-jungin/dualpath","url":"https://github.com/park-jungin/dualpath"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-hmdb51","slug":"action-classification-on-hmdb51","dataset":"HMDB51","dataset_url":"/dataset/hmdb51","rows_in_archive":1,"metrics":["Acc@1"],"first_row_in_archive_order":{"model":"DualPath w/ ViT-B/16 MLPs.","paper_title":"Dual-path Adaptation from Image to Video Transformers","paper_url":"/paper/dual-path-adaptation-from-image-to-video","paper_date":"2023-03-17","arxiv_id":"2303.09857","code_links":[{"title":"park-jungin/dualpath","url":"https://github.com/park-jungin/dualpath"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-jester-test","slug":"action-classification-on-jester-test","dataset":"Jester test","dataset_url":"/dataset/jester-gesture-recognition","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"C2F","paper_title":"Towards Efficient Coarse-to-Fine Networks for Action and Gesture Recognition","paper_url":"/paper/towards-efficient-coarse-to-fine-networks-for","paper_date":"","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-minikinetics","slug":"action-classification-on-minikinetics","dataset":"MiniKinetics","dataset_url":"/dataset/kinetics","rows_in_archive":1,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"MARS+RGB+Flow (16 frames)","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","paper_url":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_date":"2019-06-01","arxiv_id":null,"code_links":[{"title":"craston/MARS","url":"https://github.com/craston/MARS"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-something-something-2","slug":"action-classification-on-something-something-2","dataset":"Something-Something V2","dataset_url":"/dataset/something-something-v2","rows_in_archive":1,"metrics":["Acc@1","Acc@5"],"first_row_in_archive_order":{"model":"AdaMAE","paper_title":"AdaMAE: Adaptive Masking for Efficient Spatiotemporal Learning with Masked Autoencoders","paper_url":"/paper/adamae-adaptive-masking-for-efficient","paper_date":"2022-11-16","arxiv_id":"2211.09120","code_links":[{"title":"wgcban/adamae","url":"https://github.com/wgcban/adamae"},{"title":"Nithin-GK/UniteandConquer","url":"https://github.com/Nithin-GK/UniteandConquer"}],"syntology":{"n":25,"n_ran":9,"n_unverified":16,"n_pointer_only":0}}},{"leaderboard":"/sota/action-classification-on-thumos-14","slug":"action-classification-on-thumos-14","dataset":"THUMOS'14","dataset_url":"/dataset/thumos14-1","rows_in_archive":1,"metrics":["mAP"],"first_row_in_archive_order":{"model":"3C-Net","paper_title":"3C-Net: Category Count and Center Loss for Weakly-Supervised Action Localization","paper_url":"/paper/3c-net-category-count-and-center-loss-for","paper_date":"2019-08-22","arxiv_id":"1908.08216","code_links":[{"title":"naraysa/3c-net","url":"https://github.com/naraysa/3c-net"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-ttstroke-21-me21","slug":"action-classification-on-ttstroke-21-me21","dataset":"TTStroke-21 ME21","dataset_url":"/dataset/ttstroke-21-me21","rows_in_archive":1,"metrics":["Acc"],"first_row_in_archive_order":{"model":"STCNN","paper_title":"Spatio-Temporal CNN baseline method for the Sports Video Task of MediaEval 2021 benchmark","paper_url":"/paper/spatio-temporal-cnn-baseline-method-for-the","paper_date":"2021-12-16","arxiv_id":"2112.12074","code_links":[{"title":"ccp-eva/sporttaskme21","url":"https://github.com/ccp-eva/sporttaskme21"}],"syntology":null}},{"leaderboard":"/sota/action-classification-on-ucf101","slug":"action-classification-on-ucf101","dataset":"UCF101","dataset_url":"/dataset/ucf101","rows_in_archive":1,"metrics":["Top-1"],"first_row_in_archive_order":{"model":"Ours","paper_title":"SPAct: Self-supervised Privacy Preservation for Action Recognition","paper_url":"/paper/spact-self-supervised-privacy-preservation","paper_date":"2022-03-29","arxiv_id":"2203.15205","code_links":[{"title":"daveishan/spact","url":"https://github.com/daveishan/spact"}],"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/action-classification-on-wifall","slug":"action-classification-on-wifall","dataset":"WiFall","dataset_url":"/dataset/wifall","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"CSI-BERT2","paper_title":"Mining Limited Data Sufficiently: A BERT-inspired Approach for CSI Time Series Application in Wireless Communication and Sensing","paper_url":"/paper/mining-limited-data-sufficiently-a-bert","paper_date":"2024-12-09","arxiv_id":"2412.06861","code_links":[],"syntology":null}},{"leaderboard":"/sota/action-classification-on-youcook2","slug":"action-classification-on-youcook2","dataset":"YouCook2","dataset_url":"/dataset/youcook2","rows_in_archive":1,"metrics":["Object Top 5 Accuracy","Object Top-1 Accuracy","Verb Top-1 Accuracy","Verb Top-5 Accuracy"],"first_row_in_archive_order":{"model":"VideoBERT (cross modal)","paper_title":"VideoBERT: A Joint Model for Video and Language Representation Learning","paper_url":"/paper/videobert-a-joint-model-for-video-and","paper_date":"2019-04-03","arxiv_id":"1904.01766","code_links":[{"title":"ammesatyajit/VideoBERT","url":"https://github.com/ammesatyajit/VideoBERT"},{"title":"MDSKUL/MasterProject","url":"https://github.com/MDSKUL/MasterProject"},{"title":"parkervg/allrecipes-bert","url":"https://github.com/parkervg/allrecipes-bert"}],"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/hmdb51","name":"HMDB51","full_name":"","num_papers_in_archive":839},{"url":"/dataset/activitynet","name":"ActivityNet","full_name":"","num_papers_in_archive":807},{"url":"/dataset/kinetics-400-1","name":"Kinetics 400","full_name":"","num_papers_in_archive":712},{"url":"/dataset/charades","name":"Charades","full_name":"","num_papers_in_archive":428},{"url":"/dataset/thumos14-1","name":"THUMOS14","full_name":"","num_papers_in_archive":318},{"url":"/dataset/something-something-v2","name":"Something-Something V2","full_name":"","num_papers_in_archive":290},{"url":"/dataset/youcook2","name":"YouCook2","full_name":"","num_papers_in_archive":198},{"url":"/dataset/kinetics-600","name":"Kinetics-600","full_name":"","num_papers_in_archive":148},{"url":"/dataset/kinetics-700","name":"Kinetics-700","full_name":"Kinetics-700","num_papers_in_archive":95},{"url":"/dataset/babel-1","name":"BABEL","full_name":"","num_papers_in_archive":72},{"url":"/dataset/wlasl","name":"WLASL","full_name":"Word-Level American Sign Language","num_papers_in_archive":66},{"url":"/dataset/soccernet-v2","name":"SoccerNet-v2","full_name":"","num_papers_in_archive":58},{"url":"/dataset/soccernet","name":"SoccerNet","full_name":"","num_papers_in_archive":53},{"url":"/dataset/celebv-hq","name":"CelebV-HQ","full_name":"","num_papers_in_archive":36},{"url":"/dataset/toyota-smarthome","name":"Toyota Smarthome Dataset","full_name":"","num_papers_in_archive":31},{"url":"/dataset/toyota-smarthome-dataset","name":"Toyota Smarthome dataset","full_name":"Toyota Smarthome Trimmed","num_papers_in_archive":23},{"url":"/dataset/jester-gesture-recognition","name":"Jester (Gesture Recognition)","full_name":"","num_papers_in_archive":16},{"url":"/dataset/rwf-2000","name":"RWF-2000","full_name":"","num_papers_in_archive":16},{"url":"/dataset/haa500","name":"HAA500","full_name":"Human-Centric Atomic Action Dataset","num_papers_in_archive":14},{"url":"/dataset/mimetics","name":"Mimetics","full_name":"","num_papers_in_archive":11},{"url":"/dataset/avid","name":"AViD","full_name":"","num_papers_in_archive":9},{"url":"/dataset/kinetics-700-2020","name":"Kinetics-700-2020","full_name":"","num_papers_in_archive":9},{"url":"/dataset/sims4action","name":"Sims4Action","full_name":"","num_papers_in_archive":5},{"url":"/dataset/soccerdb","name":"SoccerDB","full_name":"","num_papers_in_archive":5},{"url":"/dataset/wigesture","name":"WiGesture","full_name":"Wireless Sensing Dataset for Gesture Recognition and People ID Identification with ESP32","num_papers_in_archive":5},{"url":"/dataset/ttstroke-21-me21","name":"TTStroke-21 ME21","full_name":"TTStroke-21 for MediaEval 2021","num_papers_in_archive":3},{"url":"/dataset/ttstroke-21","name":"TTStroke-21 ME22","full_name":"TTStroke-21 for MediaEval 2022","num_papers_in_archive":3},{"url":"/dataset/wifall","name":"WiFall","full_name":"Wireless Sensing Dataset for Fall Detection, Action Recognition and People ID Identification with ESP32-S3","num_papers_in_archive":2},{"url":"/dataset/mlb","name":"MLB","full_name":"Mouse Lockbox Dataset","num_papers_in_archive":1},{"url":"/dataset/win-fail-action-understanding","name":"Win-Fail Action Understanding","full_name":"Win-Fail Action Understanding","num_papers_in_archive":1},{"url":"/dataset/infiniterep","name":"InfiniteRep","full_name":"InfiniteRep","num_papers_in_archive":0}],"subtasks":[],"parent_tasks":[{"url":"/task/video","name":"Video"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":251,"tagged_in_all":457,"items":[{"url":"/paper/high-quality-monocular-depth-estimation-via","title":"High Quality Monocular Depth Estimation via Transfer Learning","date":"2018-12-31","arxiv_id":"1812.11941","repositories_listed":45,"syntology":{"n":23,"n_ran":5,"n_unverified":18,"n_pointer_only":3}},{"url":"/paper/quo-vadis-action-recognition-a-new-model-and","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","date":"2017-05-22","arxiv_id":"1705.07750","repositories_listed":34,"syntology":{"n":28,"n_ran":16,"n_unverified":12,"n_pointer_only":7}},{"url":"/paper/non-local-neural-networks","title":"Non-local Neural Networks","date":"2017-11-21","arxiv_id":"1711.07971","repositories_listed":32,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/drop-an-octave-reducing-spatial-redundancy-in","title":"Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution","date":"2019-04-10","arxiv_id":"1904.05049","repositories_listed":28,"syntology":{"n":34,"n_ran":14,"n_unverified":20,"n_pointer_only":8}},{"url":"/paper/a-closer-look-at-spatiotemporal-convolutions","title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","date":"2017-11-30","arxiv_id":"1711.11248","repositories_listed":24,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/swin-transformer-v2-scaling-up-capacity-and","title":"Swin Transformer V2: Scaling Up Capacity and Resolution","date":"2021-11-18","arxiv_id":"2111.09883","repositories_listed":23,"syntology":{"n":30,"n_ran":3,"n_unverified":27,"n_pointer_only":0}},{"url":"/paper/temporal-segment-networks-towards-good","title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","date":"2016-08-02","arxiv_id":"1608.00859","repositories_listed":22,"syntology":{"n":24,"n_ran":2,"n_unverified":22,"n_pointer_only":3}},{"url":"/paper/is-space-time-attention-all-you-need-for","title":"Is Space-Time Attention All You Need for Video Understanding?","date":"2021-02-09","arxiv_id":"2102.05095","repositories_listed":16,"syntology":{"n":43,"n_ran":35,"n_unverified":8,"n_pointer_only":14}},{"url":"/paper/video-swin-transformer","title":"Video Swin Transformer","date":"2021-06-24","arxiv_id":"2106.13230","repositories_listed":15,"syntology":{"n":32,"n_ran":7,"n_unverified":25,"n_pointer_only":0}},{"url":"/paper/slowfast-networks-for-video-recognition","title":"SlowFast Networks for Video Recognition","date":"2018-12-10","arxiv_id":"1812.03982","repositories_listed":15,"syntology":{"n":10,"n_ran":0,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/temporal-shift-module-for-efficient-video","title":"TSM: Temporal Shift Module for Efficient Video Understanding","date":"2018-11-20","arxiv_id":"1811.08383","repositories_listed":13,"syntology":{"n":16,"n_ran":6,"n_unverified":10,"n_pointer_only":4}},{"url":"/paper/the-kinetics-human-action-video-dataset","title":"The Kinetics Human Action Video Dataset","date":"2017-05-19","arxiv_id":"1705.06950","repositories_listed":13,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","date":"2021-06-21","arxiv_id":"2106.11297","repositories_listed":11,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/temporal-segment-networks-for-action","title":"Temporal Segment Networks for Action Recognition in Videos","date":"2017-05-08","arxiv_id":"1705.02953","repositories_listed":11,"syntology":null},{"url":"/paper/2103-15691","title":"ViViT: A Video Vision Transformer","date":"2021-03-29","arxiv_id":"2103.15691","repositories_listed":10,"syntology":{"n":21,"n_ran":14,"n_unverified":7,"n_pointer_only":1}},{"url":"/paper/videomae-masked-autoencoders-are-data-1","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","date":"2022-03-23","arxiv_id":"2203.12602","repositories_listed":9,"syntology":{"n":13,"n_ran":9,"n_unverified":4,"n_pointer_only":12}},{"url":"/paper/improved-multiscale-vision-transformers-for","title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","date":"2021-12-02","arxiv_id":"2112.01526","repositories_listed":9,"syntology":null},{"url":"/paper/graph-based-global-reasoning-networks","title":"Graph-Based Global Reasoning Networks","date":"2018-11-30","arxiv_id":"1811.12814","repositories_listed":9,"syntology":{"n":15,"n_ran":8,"n_unverified":7,"n_pointer_only":4}},{"url":"/paper/multiscale-vision-transformers","title":"Multiscale Vision Transformers","date":"2021-04-22","arxiv_id":"2104.11227","repositories_listed":8,"syntology":{"n":26,"n_ran":13,"n_unverified":13,"n_pointer_only":5}},{"url":"/paper/x3d-expanding-architectures-for-efficient","title":"X3D: Expanding Architectures for Efficient Video Recognition","date":"2020-04-09","arxiv_id":"2004.04730","repositories_listed":8,"syntology":{"n":15,"n_ran":2,"n_unverified":13,"n_pointer_only":0}},{"url":"/paper/video-classification-with-channel-separated","title":"Video Classification with Channel-Separated Convolutional Networks","date":"2019-04-04","arxiv_id":"1904.02811","repositories_listed":7,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/two-stream-convolutional-networks-for-action","title":"Two-Stream Convolutional Networks for Action Recognition in Videos","date":"2014-06-09","arxiv_id":"1406.2199","repositories_listed":7,"syntology":{"n":7,"n_ran":1,"n_unverified":6,"n_pointer_only":2}},{"url":"/paper/eva-exploring-the-limits-of-masked-visual","title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","date":"2022-11-14","arxiv_id":"2211.07636","repositories_listed":6,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/coca-contrastive-captioners-are-image-text","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","date":"2022-05-04","arxiv_id":"2205.01917","repositories_listed":6,"syntology":{"n":17,"n_ran":9,"n_unverified":8,"n_pointer_only":0}},{"url":"/paper/masked-feature-prediction-for-self-supervised","title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","date":"2021-12-16","arxiv_id":"2112.09133","repositories_listed":6,"syntology":null},{"url":"/paper/eco-efficient-convolutional-network-for","title":"ECO: Efficient Convolutional Network for Online Video Understanding","date":"2018-04-24","arxiv_id":"1804.09066","repositories_listed":6,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/bidirectional-cross-modal-knowledge","title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","date":"2022-12-31","arxiv_id":"2301.00182","repositories_listed":5,"syntology":null},{"url":"/paper/transferring-textual-knowledge-for-visual","title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","date":"2022-07-04","arxiv_id":"2207.01297","repositories_listed":5,"syntology":null},{"url":"/paper/revisiting-3d-resnets-for-video-recognition","title":"Revisiting 3D ResNets for Video Recognition","date":"2021-09-03","arxiv_id":"2109.01696","repositories_listed":5,"syntology":null},{"url":"/paper/vatt-transformers-for-multimodal-self","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","date":"2021-04-22","arxiv_id":"2104.11178","repositories_listed":5,"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":8}}],"syntology_records":24,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}