{"url":"/sota/action-recognition-in-videos-on-hmdb-51","task":{"name":"Action Recognition","url":"/task/action-recognition-in-videos","note":null},"dataset":{"name":"HMDB-51","url":"/dataset/hmdb51"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":"**Action Recognition** is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.\r\n\r\nIn the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos. \r\n\r\nPlease note some benchmarks may be located in the [Action Classification](https://paperswithcode.com/task/action-classification) or [Video Classification](https://paperswithcode.com/task/video-classification) tasks, e.g. Kinetics-400.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Average accuracy of 3 splits"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Average accuracy of 3 splits":"higher"}},"counts":{"rows":77,"rows_with_code":49,"rows_with_paper_page":77,"rows_dated":77,"rows_using_additional_data":33},"rows":[{"rank_in_archive_order":1,"model":"VideoMAE V2-g","metrics":{"Average accuracy of 3 splits":"88.7"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"DejaVid","metrics":{"Average accuracy of 3 splits":"88.6"},"uses_additional_data":true,"paper_date":"2025-01-01","paper":"/paper/dejavid-encoder-agnostic-learned-temporal","paper_url":"http://openaccess.thecvf.com//content/CVPR2025/html/Ho_DejaVid_Encoder-Agnostic_Learned_Temporal_Matching_for_Video_Classification_CVPR_2025_paper.html","paper_title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","code":"https://github.com/darrylho/dejavid","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"DEEP-HAL with ODF+SDF(I3D)","metrics":{"Average accuracy of 3 splits":"87.56"},"uses_additional_data":true,"paper_date":"2020-01-14","paper":"/paper/hallucinating-statistical-moment-and-subspace","paper_url":"https://arxiv.org/abs/2001.04627v2","paper_title":"Self-supervising Action Recognition by Statistical Moment and Subspace Descriptors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"TO+MaxExp+IDT","metrics":{"Average accuracy of 3 splits":"87.21"},"uses_additional_data":true,"paper_date":"2021-10-11","paper":"/paper/high-order-tensor-pooling-with-attention-for","paper_url":"https://arxiv.org/abs/2110.05216v4","paper_title":"High-order Tensor Pooling with Attention for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"SCK⊕(I3D)+IDT","metrics":{"Average accuracy of 3 splits":"86.11"},"uses_additional_data":true,"paper_date":"2020-12-28","paper":"/paper/tensor-representations-for-action-recognition","paper_url":"https://arxiv.org/abs/2012.14371v3","paper_title":"Tensor Representations for Action Recognition","code":"https://github.com/ElricXin/Skeleton-MixFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"SO+MaxExp+IDT","metrics":{"Average accuracy of 3 splits":"85.70"},"uses_additional_data":true,"paper_date":"2021-10-11","paper":"/paper/high-order-tensor-pooling-with-attention-for","paper_url":"https://arxiv.org/abs/2110.05216v4","paper_title":"High-order Tensor Pooling with Attention for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":7,"model":"R2+1D-BERT","metrics":{"Average accuracy of 3 splits":"85.10"},"uses_additional_data":true,"paper_date":"2020-08-03","paper":"/paper/late-temporal-modeling-in-3d-cnn","paper_url":"https://arxiv.org/abs/2008.01232v3","paper_title":"Late Temporal Modeling in 3D CNN Architectures with BERT for Action Recognition","code":"https://github.com/artest08/LateTemporalModeling3DCNN","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"Ours + ResNext101 BERT","metrics":{"Average accuracy of 3 splits":"84.53"},"uses_additional_data":false,"paper_date":"2020-10-16","paper":"/paper/pose-and-joint-aware-action-recognition","paper_url":"https://arxiv.org/abs/2010.08164v2","paper_title":"Pose And Joint-Aware Action Recognition","code":"https://github.com/anshulbshah/PoseAction","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"SMART","metrics":{"Average accuracy of 3 splits":"84.36"},"uses_additional_data":false,"paper_date":"2020-12-19","paper":"/paper/smart-frame-selection-for-action-recognition","paper_url":"https://arxiv.org/abs/2012.10671v1","paper_title":"SMART Frame Selection for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":10,"model":"OmniSource (SlowOnly-8x8-R101-RGB + I3D Flow)","metrics":{"Average accuracy of 3 splits":"83.8"},"uses_additional_data":true,"paper_date":"2020-03-29","paper":"/paper/omni-sourced-webly-supervised-learning-for","paper_url":"https://arxiv.org/abs/2003.13042v2","paper_title":"Omni-sourced Webly-supervised Learning for Video Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":13,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"ZeroI2V ViT-L/14","metrics":{"Average accuracy of 3 splits":"83.4"},"uses_additional_data":true,"paper_date":"2023-10-02","paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","code":"https://github.com/mcg-nju/zeroi2v","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"PERF-Net (distilled S3D-G)","metrics":{"Average accuracy of 3 splits":"83.2"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/perf-net-pose-empowered-rgb-flow-net","paper_url":"https://arxiv.org/abs/2009.13087v2","paper_title":"PERF-Net: Pose Empowered RGB-Flow Net","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"BIKE","metrics":{"Average accuracy of 3 splits":"83.1"},"uses_additional_data":true,"paper_date":"2022-12-31","paper":"/paper/bidirectional-cross-modal-knowledge","paper_url":"https://arxiv.org/abs/2301.00182v2","paper_title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":14,"model":"BubbleNET","metrics":{"Average accuracy of 3 splits":"82.60"},"uses_additional_data":true,"paper_date":"2020-10-30","paper":"/paper/bubblenet-a-disperse-recurrent-structure-to","paper_url":"https://ieeexplore.ieee.org/document/9190769","paper_title":"Bubblenet: A Disperse Recurrent Structure To Recognize Activities","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":15,"model":"HAF+BoW/FV halluc","metrics":{"Average accuracy of 3 splits":"82.48"},"uses_additional_data":true,"paper_date":"2019-06-13","paper":"/paper/hallucinating-bag-of-words-and-fisher-vector","paper_url":"https://arxiv.org/abs/1906.05910v2","paper_title":"Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition with CNNs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"CCS + TSN (ImageNet+Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"81.9"},"uses_additional_data":true,"paper_date":"2019-08-27","paper":"/paper/cooperative-cross-stream-network-for","paper_url":"https://arxiv.org/abs/1908.10136v1","paper_title":"Cooperative Cross-Stream Network for Discriminative Action Representation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":17,"model":"RepFlow-50 ([2+1]D CNN, FcF, Non-local block)","metrics":{"Average accuracy of 3 splits":"81.1"},"uses_additional_data":false,"paper_date":"2018-10-02","paper":"/paper/representation-flow-for-action-recognition","paper_url":"https://arxiv.org/abs/1810.01455v3","paper_title":"Representation Flow for Action Recognition","code":"https://github.com/piergiaj/representation-flow-cvpr19","n_code_links":5,"syntology":null},{"rank_in_archive_order":18,"model":"Multi-stream I3D","metrics":{"Average accuracy of 3 splits":"80.92"},"uses_additional_data":false,"paper_date":"2019-03-20","paper":"/paper/contextual-action-cues-from-camera-sensor-for","paper_url":"https://doi.org/10.3390/s19061382","paper_title":"Contextual Action Cues from Camera Sensor for Multi-Stream Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":19,"model":"MARS+RGB+FLow (64 frames, Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"80.9"},"uses_additional_data":true,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"Two-stream I3D","metrics":{"Average accuracy of 3 splits":"80.9"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":21,"model":"Two-Stream I3D (Imagenet+Kinetics pre-training)","metrics":{"Average accuracy of 3 splits":"80.7"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":22,"model":"LGD-3D Two-stream","metrics":{"Average accuracy of 3 splits":"80.5"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"D3D + D3D","metrics":{"Average accuracy of 3 splits":"80.5"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"AMD(ViT-B/16)","metrics":{"Average accuracy of 3 splits":"79.6"},"uses_additional_data":true,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":25,"model":"D3D (Kinetics-600 pretraining)","metrics":{"Average accuracy of 3 splits":"79.3"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"LGD-3D Flow","metrics":{"Average accuracy of 3 splits":"78.9"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"Hidden Two-Stream","metrics":{"Average accuracy of 3 splits":"78.7"},"uses_additional_data":false,"paper_date":"2017-04-02","paper":"/paper/hidden-two-stream-convolutional-networks-for","paper_url":"http://arxiv.org/abs/1704.00389v4","paper_title":"Hidden Two-Stream Convolutional Networks for Action Recognition","code":"https://github.com/bryanyzhu/two-stream-pytorch","n_code_links":3,"syntology":null},{"rank_in_archive_order":28,"model":"R[2+1]D-TwoStream (Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"78.7"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":29,"model":"D3D (Kinetics-400 pretraining)","metrics":{"Average accuracy of 3 splits":"78.7"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"I3D RGB + DMC-Net (I3D)","metrics":{"Average accuracy of 3 splits":"77.8"},"uses_additional_data":false,"paper_date":"2019-01-11","paper":"/paper/dmc-net-generating-discriminative-motion-cues","paper_url":"https://arxiv.org/abs/1901.03460v3","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":31,"model":"BQN","metrics":{"Average accuracy of 3 splits":"77.6"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/video-classification-with-finecoarse-networks","paper_url":"https://arxiv.org/abs/2103.15584v4","paper_title":"Busy-Quiet Video Disentangling for Video Classification","code":"https://github.com/guoxih/busy-quiet-net","n_code_links":2,"syntology":null},{"rank_in_archive_order":32,"model":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Average accuracy of 3 splits":"77.4"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"Flow-I3D (Kinetics pre-training)","metrics":{"Average accuracy of 3 splits":"77.3"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":34,"model":"Flow-I3D (Imagenet+Kinetics pre-training)","metrics":{"Average accuracy of 3 splits":"77.1"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":35,"model":"HATNet (32 frames)","metrics":{"Average accuracy of 3 splits":"76.5"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/holistic-large-scale-video-understanding","paper_url":"https://arxiv.org/abs/1904.11451v3","paper_title":"Large Scale Holistic Video Understanding","code":"https://github.com/holistic-video-understanding/HVU-Dataset","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"R[2+1]D-Flow (Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"76.4"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":37,"model":"S3D-G (ImageNet, Kinetics-400 pretrained)","metrics":{"Average accuracy of 3 splits":"75.9"},"uses_additional_data":false,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":38,"model":"FASTER32 (Kinetics pretrain)","metrics":{"Average accuracy of 3 splits":"75.7"},"uses_additional_data":true,"paper_date":"2019-06-10","paper":"/paper/faster-recurrent-networks-for-video","paper_url":"https://arxiv.org/abs/1906.04226v2","paper_title":"FASTER Recurrent Networks for Efficient Video Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":39,"model":"LGD-3D RGB","metrics":{"Average accuracy of 3 splits":"75.7"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"RGB-I3D (Imagenet+Kinetics pre-training)","metrics":{"Average accuracy of 3 splits":"74.8"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":41,"model":"R[2+1]D-RGB (Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"74.5"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":42,"model":"VidTr-L","metrics":{"Average accuracy of 3 splits":"74.4"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"ADL+ResNet+IDT","metrics":{"Average accuracy of 3 splits":"74.3"},"uses_additional_data":false,"paper_date":"2018-07-24","paper":"/paper/learning-discriminative-video-representations","paper_url":"https://arxiv.org/abs/1807.09380v3","paper_title":"Contrastive Video Representation Learning via Adversarial Perturbations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"RGB-I3D (Kinetics pre-training)","metrics":{"Average accuracy of 3 splits":"74.3"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":45,"model":"Optical Flow Guided Feature","metrics":{"Average accuracy of 3 splits":"74.2"},"uses_additional_data":false,"paper_date":"2017-11-29","paper":"/paper/optical-flow-guided-feature-a-fast-and-robust","paper_url":"http://arxiv.org/abs/1711.11152v2","paper_title":"Optical Flow Guided Feature: A Fast and Robust Motion Representation for Video Action Recognition","code":"https://github.com/kevin-ssy/Optical-Flow-Guided-Feature","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"R[2+1D]D-TwoStream (Sports1M pretrained)","metrics":{"Average accuracy of 3 splits":"72.7"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":47,"model":"TVNet+IDT","metrics":{"Average accuracy of 3 splits":"72.6"},"uses_additional_data":false,"paper_date":"2018-04-02","paper":"/paper/end-to-end-learning-of-motion-representation","paper_url":"http://arxiv.org/abs/1804.00413v1","paper_title":"End-to-End Learning of Motion Representation for Video Understanding","code":"https://github.com/LijieFan/tvnet","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"STM Network+IDT","metrics":{"Average accuracy of 3 splits":"72.2"},"uses_additional_data":false,"paper_date":"2017-07-01","paper":"/paper/spatiotemporal-multiplier-networks-for-video","paper_url":"http://openaccess.thecvf.com/content_cvpr_2017/html/Feichtenhofer_Spatiotemporal_Multiplier_Networks_CVPR_2017_paper.html","paper_title":"Spatiotemporal Multiplier Networks for Video Action Recognition","code":"https://github.com/feichtenhofer/st-resnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"Prob-Distill","metrics":{"Average accuracy of 3 splits":"72.0"},"uses_additional_data":false,"paper_date":"2019-04-05","paper":"/paper/paying-more-attention-to-motion-attention","paper_url":"https://arxiv.org/abs/1904.03249v2","paper_title":"Attention Distillation for Learning Video Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":50,"model":"DMC-Net (I3D)","metrics":{"Average accuracy of 3 splits":"71.8"},"uses_additional_data":false,"paper_date":"2019-01-11","paper":"/paper/dmc-net-generating-discriminative-motion-cues","paper_url":"https://arxiv.org/abs/1901.03460v3","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":51,"model":"TesNet (ImageNet pretrained)","metrics":{"Average accuracy of 3 splits":"71.5"},"uses_additional_data":false,"paper_date":"2020-02-11","paper":"/paper/learning-spatio-temporal-representations-with","paper_url":"https://arxiv.org/abs/2002.04685v2","paper_title":"Learning spatio-temporal representations with temporal squeeze pooling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"HF-ECOLite (ImageNet+Kinetics pretrain)","metrics":{"Average accuracy of 3 splits":"71.13"},"uses_additional_data":true,"paper_date":"2019-05-29","paper":"/paper/hierarchical-feature-aggregation-networks-for","paper_url":"https://arxiv.org/abs/1905.12462v1","paper_title":"Hierarchical Feature Aggregation Networks for Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"ARTNet w/ TSN","metrics":{"Average accuracy of 3 splits":"70.9"},"uses_additional_data":false,"paper_date":"2017-11-24","paper":"/paper/appearance-and-relation-networks-for-video","paper_url":"http://arxiv.org/abs/1711.09125v2","paper_title":"Appearance-and-Relation Networks for Video Classification","code":"https://github.com/wanglimin/ARTNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":54,"model":"ST-ResNet + IDT","metrics":{"Average accuracy of 3 splits":"70.3"},"uses_additional_data":false,"paper_date":"2016-11-07","paper":"/paper/spatiotemporal-residual-networks-for-video","paper_url":"http://arxiv.org/abs/1611.02155v1","paper_title":"Spatiotemporal Residual Networks for Video Action Recognition","code":"https://github.com/feichtenhofer/st-resnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"R[2+1]D-Flow (Sports1M pretrained)","metrics":{"Average accuracy of 3 splits":"70.1"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":56,"model":"Temporal Segment Networks","metrics":{"Average accuracy of 3 splits":"69.4"},"uses_additional_data":false,"paper_date":"2016-08-02","paper":"/paper/temporal-segment-networks-towards-good","paper_url":"http://arxiv.org/abs/1608.00859v1","paper_title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":22,"syntology":{"n_ran":2,"n_unverified":22,"n_samples":24,"n_pointer_only_licence":3}},{"rank_in_archive_order":57,"model":"TS-LSTM","metrics":{"Average accuracy of 3 splits":"69"},"uses_additional_data":false,"paper_date":"2017-03-30","paper":"/paper/ts-lstm-and-temporal-inception-exploiting","paper_url":"http://arxiv.org/abs/1703.10667v1","paper_title":"TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition","code":"https://github.com/jeffreyhuang1/two-stream-action-recognition","n_code_links":4,"syntology":null},{"rank_in_archive_order":58,"model":"SVT","metrics":{"Average accuracy of 3 splits":"67.2"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/self-supervised-video-transformer","paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","code":"https://github.com/kahnchana/svt","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"R[2+1]D-RGB (Sports1M pretrained)","metrics":{"Average accuracy of 3 splits":"66.6"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":60,"model":"TDD + IDT","metrics":{"Average accuracy of 3 splits":"65.9"},"uses_additional_data":false,"paper_date":"2015-05-19","paper":"/paper/action-recognition-with-trajectory-pooled","paper_url":"http://arxiv.org/abs/1505.04868v1","paper_title":"Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors","code":"https://github.com/damien911224/theWorldInSafety","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"VIMPAC","metrics":{"Average accuracy of 3 splits":"65.9"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/vimpac-video-pre-training-via-masked-token","paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","code":"https://github.com/airsplay/vimpac","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":62,"model":"S:VGG-16, T:VGG-16 (ImageNet pretrained)","metrics":{"Average accuracy of 3 splits":"65.4"},"uses_additional_data":true,"paper_date":"2016-04-22","paper":"/paper/convolutional-two-stream-network-fusion-for","paper_url":"http://arxiv.org/abs/1604.06573v2","paper_title":"Convolutional Two-Stream Network Fusion for Video Action Recognition","code":"https://github.com/feichtenhofer/twostreamfusion","n_code_links":2,"syntology":null},{"rank_in_archive_order":63,"model":"Dynamic Image Networks + IDT","metrics":{"Average accuracy of 3 splits":"65.2"},"uses_additional_data":false,"paper_date":"2016-06-01","paper":"/paper/dynamic-image-networks-for-action-recognition","paper_url":"http://openaccess.thecvf.com/content_cvpr_2016/html/Bilen_Dynamic_Image_Networks_CVPR_2016_paper.html","paper_title":"Dynamic Image Networks for Action Recognition","code":"https://github.com/hbilen/dynamic-image-nets","n_code_links":1,"syntology":null},{"rank_in_archive_order":64,"model":"LTC","metrics":{"Average accuracy of 3 splits":"64.8"},"uses_additional_data":false,"paper_date":"2016-04-15","paper":"/paper/long-term-temporal-convolutions-for-action","paper_url":"http://arxiv.org/abs/1604.04494v2","paper_title":"Long-term Temporal Convolutions for Action Recognition","code":"https://github.com/gulvarol/ltc","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"R-STAN-50","metrics":{"Average accuracy of 3 splits":"62.8"},"uses_additional_data":false,"paper_date":"2019-06-19","paper":"/paper/r-stan-residual-spatial-temporal-attention","paper_url":"https://doi.org/10.1109/ACCESS.2019.2923651","paper_title":"R-STAN: Residual Spatial-Temporal Attention Network for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":66,"model":"DMC-Net (ResNet-18)","metrics":{"Average accuracy of 3 splits":"62.8"},"uses_additional_data":false,"paper_date":"2019-01-11","paper":"/paper/dmc-net-generating-discriminative-motion-cues","paper_url":"https://arxiv.org/abs/1901.03460v3","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":67,"model":"SUSiNet (multi, Kinetics pretrained)","metrics":{"Average accuracy of 3 splits":"62.7"},"uses_additional_data":true,"paper_date":"2018-12-03","paper":"/paper/susinet-see-understand-and-summarize-it","paper_url":"http://arxiv.org/abs/1812.00722v2","paper_title":"SUSiNet: See, Understand and Summarize it","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":68,"model":"Two-Stream (ImageNet pretrained)","metrics":{"Average accuracy of 3 splits":"59.4"},"uses_additional_data":true,"paper_date":"2014-06-09","paper":"/paper/two-stream-convolutional-networks-for-action","paper_url":"http://arxiv.org/abs/1406.2199v2","paper_title":"Two-Stream Convolutional Networks for Action Recognition in Videos","code":"https://github.com/feichtenhofer/twostreamfusion","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":2}},{"rank_in_archive_order":69,"model":"ActionFlowNet","metrics":{"Average accuracy of 3 splits":"56.4"},"uses_additional_data":false,"paper_date":"2016-12-09","paper":"/paper/actionflownet-learning-motion-representation","paper_url":"http://arxiv.org/abs/1612.03052v3","paper_title":"ActionFlowNet: Learning Motion Representation for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":70,"model":"R-STAN-152","metrics":{"Average accuracy of 3 splits":"55.16"},"uses_additional_data":false,"paper_date":"2019-06-19","paper":"/paper/r-stan-residual-spatial-temporal-attention","paper_url":"https://doi.org/10.1109/ACCESS.2019.2923651","paper_title":"R-STAN: Residual Spatial-Temporal Attention Network for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":71,"model":"Res3D","metrics":{"Average accuracy of 3 splits":"54.9"},"uses_additional_data":false,"paper_date":"2017-08-16","paper":"/paper/convnet-architecture-search-for","paper_url":"http://arxiv.org/abs/1708.05038v1","paper_title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","code":"https://github.com/farazahmeds/Classification-of-brain-tumor-using-Spatiotemporal-models","n_code_links":1,"syntology":null},{"rank_in_archive_order":72,"model":"R(2+1)D-18 (DistInit pretraining)","metrics":{"Average accuracy of 3 splits":"54.8"},"uses_additional_data":true,"paper_date":"2019-01-26","paper":"/paper/distinit-learning-video-representations","paper_url":"https://arxiv.org/abs/1901.09244v2","paper_title":"DistInit: Learning Video Representations Without a Single Labeled Video","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":73,"model":"JRMN","metrics":{"Average accuracy of 3 splits":"54.2"},"uses_additional_data":false,"paper_date":"2020-10-16","paper":"/paper/pose-and-joint-aware-action-recognition","paper_url":"https://arxiv.org/abs/2010.08164v2","paper_title":"Pose And Joint-Aware Action Recognition","code":"https://github.com/anshulbshah/PoseAction","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"CD-UAR","metrics":{"Average accuracy of 3 splits":"51.8"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/towards-universal-representation-for-unseen","paper_url":"http://arxiv.org/abs/1803.08460v1","paper_title":"Towards Universal Representation for Unseen Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":75,"model":"C3D","metrics":{"Average accuracy of 3 splits":"51.6"},"uses_additional_data":false,"paper_date":"2014-12-02","paper":"/paper/learning-spatiotemporal-features-with-3d","paper_url":"http://arxiv.org/abs/1412.0767v4","paper_title":"Learning Spatiotemporal Features with 3D Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":29,"syntology":null},{"rank_in_archive_order":76,"model":"R[2+1]D (VideoMoCo)","metrics":{"Average accuracy of 3 splits":"49.2"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/videomoco-contrastive-video-representation","paper_url":"https://arxiv.org/abs/2103.05905v2","paper_title":"VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples","code":"https://github.com/tinapan-pt/VideoMoCo","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":77,"model":"3D-ResNet-18 (VideoMoCo)","metrics":{"Average accuracy of 3 splits":"43.6"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/videomoco-contrastive-video-representation","paper_url":"https://arxiv.org/abs/2103.05905v2","paper_title":"VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples","code":"https://github.com/tinapan-pt/VideoMoCo","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":23,"rows_with_any_sample_ran":20,"distinct_papers_with_graph_line":12,"distinct_papers_with_any_sample_ran":9,"samples_over_distinct_papers":{"n_ran":28,"n_unverified":70,"n_samples":98,"n_pointer_only_licence":18,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":114,"n_unverified":145,"n_samples":259,"n_pointer_only_licence":74,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}