{"url":"/sota/action-recognition-in-videos-on-something-1","task":{"name":"Action Recognition","url":"/task/action-recognition-in-videos","note":null},"dataset":{"name":"Something-Something V1","url":"/dataset/something-something-v1"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":"**Action Recognition** is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.\r\n\r\nIn the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos. \r\n\r\nPlease note some benchmarks may be located in the [Action Classification](https://paperswithcode.com/task/action-classification) or [Video Classification](https://paperswithcode.com/task/video-classification) tasks, e.g. Kinetics-400.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top 1 Accuracy","Top 5 Accuracy","Param.","GFLOPs"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top 1 Accuracy":"higher","Top 5 Accuracy":"higher","Param.":null,"GFLOPs":null}},"counts":{"rows":74,"rows_with_code":60,"rows_with_paper_page":74,"rows_dated":74,"rows_using_additional_data":23},"rows":[{"rank_in_archive_order":1,"model":"InternVideo","metrics":{"Top 1 Accuracy":"70.0"},"uses_additional_data":true,"paper_date":"2022-12-06","paper":"/paper/internvideo-general-video-foundation-models","paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"VideoMAE V2-g","metrics":{"Top 1 Accuracy":"68.7","Top 5 Accuracy":"91.9"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"Side4Video (EVA ViT-E/14","metrics":{"Top 1 Accuracy":"67.3","Top 5 Accuracy":"88.8"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/side4video-spatial-temporal-side-network-for","paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":null},{"rank_in_archive_order":4,"model":"ATM","metrics":{"Top 1 Accuracy":"65.6","Top 5 Accuracy":"88.6"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/what-can-simple-arithmetic-operations-do-for","paper_url":"https://arxiv.org/abs/2307.08908v2","paper_title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"TAdaFormer-L/14","metrics":{"Top 1 Accuracy":"63.7"},"uses_additional_data":true,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"TDS-CLIP-ViT-L/14(8frames)","metrics":{"Top 1 Accuracy":"63.0","Top 5 Accuracy":"87.8"},"uses_additional_data":false,"paper_date":"2024-08-20","paper":"/paper/tds-clip-temporal-difference-side-network-for","paper_url":"https://arxiv.org/abs/2408.10688v1","paper_title":"TDS-CLIP: Temporal Difference Side Network for Image-to-Video Transfer Learning","code":"https://github.com/BBYL9413/TDS-CLIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"UniFormerV2-L","metrics":{"Top 1 Accuracy":"62.7","Top 5 Accuracy":"88.0"},"uses_additional_data":true,"paper_date":"2022-09-22","paper":"/paper/uniformerv2-spatiotemporal-learning-by-arming","paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","code":"https://github.com/OpenGVLab/UniFormerV2","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"StructVit-B-4-1","metrics":{"Top 1 Accuracy":"61.3"},"uses_additional_data":false,"paper_date":"2024-04-05","paper":"/paper/learning-correlation-structures-for-vision","paper_url":"https://arxiv.org/abs/2404.03924v1","paper_title":"Learning Correlation Structures for Vision Transformers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"UniFormer-B (IN-1K + Kinetics400)","metrics":{"GFLOPs":"259x3","Param.":"50.1","Top 1 Accuracy":"60.9","Top 5 Accuracy":"87.3"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/uniformer-unified-transformer-for-efficient","paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":10,"model":"TAdaConvNeXtV2-B","metrics":{"Top 1 Accuracy":"60.7"},"uses_additional_data":true,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"TPS","metrics":{"Top 1 Accuracy":"58.3"},"uses_additional_data":false,"paper_date":"2022-07-27","paper":"/paper/spatiotemporal-self-attention-modeling-with","paper_url":"https://arxiv.org/abs/2207.13259v1","paper_title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","code":"https://github.com/martinxm/tps","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"MSMA (8+16frames)","metrics":{"Top 1 Accuracy":"57.9"},"uses_additional_data":false,"paper_date":"2023-02-19","paper":"/paper/multi-scale-motion-aware-module-for-video","paper_url":"https://link.springer.com/chapter/10.1007/978-3-031-25075-0_40","paper_title":"Multi-scale Motion-Aware Module for Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":13,"model":"UniFormer-B (IN-1K + Kinetics600)","metrics":{"GFLOPs":"41.8x3","Param.":"21.4","Top 1 Accuracy":"57.6","Top 5 Accuracy":"84.9"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/uniformer-unified-transformer-for-efficient","paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":14,"model":"SIFA","metrics":{"Top 1 Accuracy":"57.3"},"uses_additional_data":false,"paper_date":"2022-06-14","paper":"/paper/stand-alone-inter-frame-attention-in-video-1","paper_url":"https://arxiv.org/abs/2206.06931v1","paper_title":"Stand-Alone Inter-Frame Attention in Video Models","code":"https://github.com/fuchenustc/sifa","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"EAN ResNet50 (single clip, center crop,8+16 ensemble, with sparse Transformer)","metrics":{"Top 1 Accuracy":"57.2","Top 5 Accuracy":"83.9"},"uses_additional_data":false,"paper_date":"2021-07-22","paper":"/paper/ean-event-adaptive-network-for-enhanced","paper_url":"https://arxiv.org/abs/2107.10771v2","paper_title":"EAN: Event Adaptive Network for Enhanced Action Recognition","code":"https://github.com/tianyuan168326/EAN-Pytorch","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"TCM (Ensemble)","metrics":{"Top 1 Accuracy":"57.2"},"uses_additional_data":false,"paper_date":"2022-02-24","paper":"/paper/slow-fast-visual-tempo-learning-for-video","paper_url":"https://arxiv.org/abs/2202.12116v2","paper_title":"Motion-driven Visual Tempo Learning for Video-based Action Recognition","code":"https://github.com/yzfly/tcm","n_code_links":2,"syntology":null},{"rank_in_archive_order":17,"model":"BQNEn (ImageNet + K400 pretrained)","metrics":{"Top 1 Accuracy":"57.1","Top 5 Accuracy":"84.2"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/video-classification-with-finecoarse-networks","paper_url":"https://arxiv.org/abs/2103.15584v4","paper_title":"Busy-Quiet Video Disentangling for Video Classification","code":"https://github.com/guoxih/busy-quiet-net","n_code_links":2,"syntology":null},{"rank_in_archive_order":18,"model":"TDN ResNet101 (one clip, center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"Top 1 Accuracy":"56.8","Top 5 Accuracy":"84.1"},"uses_additional_data":false,"paper_date":"2020-12-18","paper":"/paper/tdn-temporal-difference-networks-for","paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","code":"https://github.com/MCG-NJU/TDN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top 1 Accuracy":"56.6","Top 5 Accuracy":"84.4"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":20,"model":"CT-Net Ensemble (R50, 8+12+16+24)","metrics":{"Top 1 Accuracy":"56.6"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/ct-net-channel-tensorization-network-for-1","paper_url":"https://arxiv.org/abs/2106.01603v1","paper_title":"CT-Net: Channel Tensorization Network for Video Classification","code":"https://github.com/Andy1621/CT-Net","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"MoDS (8+16frames)","metrics":{"Top 1 Accuracy":"56.6"},"uses_additional_data":false,"paper_date":"2022-07-15","paper":"/paper/action-recognition-with-motion","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=9831068","paper_title":"Action Recognition With Motion Diversification and Dynamic Selection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":22,"model":"MLP-3D","metrics":{"Top 1 Accuracy":"56.5"},"uses_additional_data":false,"paper_date":"2022-06-13","paper":"/paper/mlp-3d-a-mlp-like-3d-architecture-with-1","paper_url":"https://arxiv.org/abs/2206.06292v1","paper_title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top 1 Accuracy":"56.1","Top 5 Accuracy":"82.8"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":24,"model":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top 1 Accuracy":"55.8","Top 5 Accuracy":"83.9"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":25,"model":"RSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top 1 Accuracy":"55.5","Top 5 Accuracy":"82.6"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":26,"model":"PAN ResNet101 (RGB only, no Flow)","metrics":{"Top 1 Accuracy":"55.3","Top 5 Accuracy":"82.8"},"uses_additional_data":false,"paper_date":"2020-08-08","paper":"/paper/pan-towards-fast-action-recognition-via","paper_url":"https://arxiv.org/abs/2008.03462v1","paper_title":"PAN: Towards Fast Action Recognition via Learning Persistence of Appearance","code":"https://github.com/zhang-can/PAN-PyTorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":27,"model":"GSM Ensemble InceptionV3 (ImageNet pretrained)","metrics":{"Top 1 Accuracy":"55.16"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/gate-shift-networks-for-video-action","paper_url":"https://arxiv.org/abs/1912.00381v2","paper_title":"Gate-Shift Networks for Video Action Recognition","code":"https://github.com/swathikirans/GSM","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":28,"model":"MSNet-R50En (ensemble)","metrics":{"Top 1 Accuracy":"55.1"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"AE-Net (8+16frames)","metrics":{"Top 1 Accuracy":"55.0"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/ae-net-adjoint-enhancement-network-for","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9835116","paper_title":"AE-Net:Adjoint Enhancement Network for Efficient Action Recognition in Video Understanding","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"VoV3D-L (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"20.9x6","Param.":"5.8M","Top 1 Accuracy":"54.59","Top 5 Accuracy":"82.30"},"uses_additional_data":true,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"MSNet-R50En (8+16 ensemble, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"54.4","Top 5 Accuracy":"83.8"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"SELFYNet-TSM-R50 (16 frames, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"54.3","Top 5 Accuracy":"82.9"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":33,"model":"RNL+TSM Ensemble(R50+R101, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"54.1","Top 5 Accuracy":"82.2"},"uses_additional_data":false,"paper_date":"2020-07-17","paper":"/paper/region-based-non-local-operation-for-video","paper_url":"https://arxiv.org/abs/2007.09033v5","paper_title":"Region-based Non-local Operation for Video Classification","code":"https://github.com/guoxih/region-based-non-local-network","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"RSANet-R50 (16 frames, ImageNet pretrained, a single clip)","metrics":{"Top 1 Accuracy":"54.0","Top 5 Accuracy":"81.1"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":35,"model":"MVFNet-R50EN","metrics":{"Top 1 Accuracy":"54.0"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/mvfnet-multi-view-fusion-network-for","paper_url":"https://arxiv.org/abs/2012.06977v2","paper_title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","code":"https://github.com/whwu95/MVFNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":36,"model":"STPG (8+16frames)","metrics":{"Top 1 Accuracy":"53.5"},"uses_additional_data":false,"paper_date":"2022-08-09","paper":"/paper/spatial-temporal-pyramid-graph-reasoning-for","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9852978","paper_title":"Spatial-Temporal Pyramid Graph Reasoning for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":37,"model":"GB + DF + LB (ResNet152, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"53.4"},"uses_additional_data":true,"paper_date":"2019-08-20","paper":"/paper/190807625","paper_url":"https://arxiv.org/abs/1908.07625v1","paper_title":"Action recognition with spatial-temporal discriminative filter banks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":38,"model":"ip-CSN-152 (IG-65M pretraining)","metrics":{"Top 1 Accuracy":"53.3"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"MARS+RGB+Flow (64 frames, Kinetics pretrained)","metrics":{"Top 1 Accuracy":"53.0"},"uses_additional_data":true,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":40,"model":"RNL+TSM Ensemble(ResNet50, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"52.7","Top 5 Accuracy":"81.5"},"uses_additional_data":false,"paper_date":"2020-07-17","paper":"/paper/region-based-non-local-operation-for-video","paper_url":"https://arxiv.org/abs/2007.09033v5","paper_title":"Region-based Non-local Operation for Video Classification","code":"https://github.com/guoxih/region-based-non-local-network","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"VoV3D-M (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"11.5x6","Param.":"3.3M","Top 1 Accuracy":"52.68","Top 5 Accuracy":"80.43"},"uses_additional_data":true,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"TSM+W3 (16 frames, ResNet50)","metrics":{"Top 1 Accuracy":"52.6","Top 5 Accuracy":"81.3"},"uses_additional_data":false,"paper_date":"2020-04-02","paper":"/paper/knowing-what-where-and-when-to-look-efficient","paper_url":"https://arxiv.org/abs/2004.01278v1","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"AK-Net","metrics":{"Top 1 Accuracy":"52.5"},"uses_additional_data":false,"paper_date":"2022-01-17","paper":"/paper/action-keypoint-network-for-efficient-video","paper_url":"https://arxiv.org/abs/2201.06304v1","paper_title":"Action Keypoint Network for Efficient Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"52.1","Top 5 Accuracy":"82.3"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"ir-CSN-152 (IG-65M pretraining)","metrics":{"Top 1 Accuracy":"52.1"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"RSANet-R50 (8 frames, ImageNet pretrained, a single clip)","metrics":{"Top 1 Accuracy":"51.9","Top 5 Accuracy":"79.6"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":47,"model":"GSM InceptionV3 (16 frames, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"51.68"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/gate-shift-networks-for-video-action","paper_url":"https://arxiv.org/abs/1912.00381v2","paper_title":"Gate-Shift Networks for Video Action Recognition","code":"https://github.com/swathikirans/GSM","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":48,"model":"R(2+1)D-152 (IG-65M pretraining)","metrics":{"Top 1 Accuracy":"51.6"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"MSNet-R50 (8 frames, ImageNet pretrained)","metrics":{"Top 1 Accuracy":"50.9","Top 5 Accuracy":"80.3"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"TSM (RGB + Flow)","metrics":{"Top 1 Accuracy":"50.7"},"uses_additional_data":false,"paper_date":"2018-11-20","paper":"/paper/temporal-shift-module-for-efficient-video","paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":13,"syntology":{"n_ran":6,"n_unverified":10,"n_samples":16,"n_pointer_only_licence":4}},{"rank_in_archive_order":51,"model":"VoV3D-L (32frames, from scratch, single)","metrics":{"GFLOPs":"20.9x6","Param.":"5.8M","Top 1 Accuracy":"50.6","Top 5 Accuracy":"78.7"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":52,"model":"ResNet50 I3D (Moments pretrained)","metrics":{"Top 1 Accuracy":"50"},"uses_additional_data":true,"paper_date":"2018-01-09","paper":"/paper/moments-in-time-dataset-one-million-videos","paper_url":"http://arxiv.org/abs/1801.03150v3","paper_title":"Moments in Time Dataset: one million videos for event understanding","code":"https://github.com/zhoubolei/moments_models","n_code_links":4,"syntology":null},{"rank_in_archive_order":53,"model":"VoV3D-M (32frames, from scratch, single)","metrics":{"GFLOPs":"11.5x6","Param.":"3.3M","Top 1 Accuracy":"49.8","Top 5 Accuracy":"78.0"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":54,"model":"TSMEn","metrics":{"Top 1 Accuracy":"49.7","Top 5 Accuracy":"78.5"},"uses_additional_data":false,"paper_date":"2018-11-20","paper":"/paper/temporal-shift-module-for-efficient-video","paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":13,"syntology":{"n_ran":6,"n_unverified":10,"n_samples":16,"n_pointer_only_licence":4}},{"rank_in_archive_order":55,"model":"TRG (Inception-V3)","metrics":{"Top 1 Accuracy":"49.7"},"uses_additional_data":false,"paper_date":"2019-08-27","paper":"/paper/temporal-reasoning-graph-for-activity","paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":56,"model":"TRG (ResNet-50)","metrics":{"Top 1 Accuracy":"49.5","Top 5 Accuracy":"86.1"},"uses_additional_data":false,"paper_date":"2019-08-27","paper":"/paper/temporal-reasoning-graph-for-activity","paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":57,"model":"VoV3D-L (16frames, from scratch, single)","metrics":{"GFLOPs":"9.3x6","Param.":"5.8M","Top 1 Accuracy":"49.5","Top 5 Accuracy":"78.0"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"ir-CSN-152","metrics":{"Top 1 Accuracy":"49.3"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"RSTG (Kinetics pretrained)","metrics":{"Top 1 Accuracy":"49.2"},"uses_additional_data":true,"paper_date":"2019-04-11","paper":"/paper/recurrent-space-time-graphs-for-video","paper_url":"https://arxiv.org/abs/1904.05582v4","paper_title":"Recurrent Space-time Graph Neural Networks","code":"https://github.com/IuliaDuta/RSTG","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":60,"model":"ResNet50 I3D (Kinetics pretrained)","metrics":{"Top 1 Accuracy":"48.6"},"uses_additional_data":true,"paper_date":"2018-01-09","paper":"/paper/moments-in-time-dataset-one-million-videos","paper_url":"http://arxiv.org/abs/1801.03150v3","paper_title":"Moments in Time Dataset: one million videos for event understanding","code":"https://github.com/zhoubolei/moments_models","n_code_links":4,"syntology":null},{"rank_in_archive_order":61,"model":"ir-CSN-101","metrics":{"Top 1 Accuracy":"48.4"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"S3D-G (ImageNet pretrained)","metrics":{"Top 1 Accuracy":"48.2","Top 5 Accuracy":"78.7"},"uses_additional_data":true,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":63,"model":"VoV3D-M (16frames, from scratch, single)","metrics":{"GFLOPs":"5.7x6","Param.":"3.3M","Top 1 Accuracy":"48.1","Top 5 Accuracy":"76.9"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":64,"model":"S3D","metrics":{"Top 1 Accuracy":"47.3","Top 5 Accuracy":"78.1"},"uses_additional_data":false,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":65,"model":"TSM","metrics":{"Top 1 Accuracy":"47.2","Top 5 Accuracy":"77.1"},"uses_additional_data":false,"paper_date":"2018-11-20","paper":"/paper/temporal-shift-module-for-efficient-video","paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":13,"syntology":{"n_ran":6,"n_unverified":10,"n_samples":16,"n_pointer_only_licence":4}},{"rank_in_archive_order":66,"model":"ECO-Net (ImageNet pretrained)","metrics":{"Top 1 Accuracy":"46.4"},"uses_additional_data":true,"paper_date":"2018-04-24","paper":"/paper/eco-efficient-convolutional-network-for","paper_url":"http://arxiv.org/abs/1804.09066v2","paper_title":"ECO: Efficient Convolutional Network for Online Video Understanding","code":"https://github.com/mzolfaghari/ECO-efficient-video-understanding","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":67,"model":"ECO-Net","metrics":{"Top 1 Accuracy":"46.4"},"uses_additional_data":false,"paper_date":"2018-04-24","paper":"/paper/eco-efficient-convolutional-network-for","paper_url":"http://arxiv.org/abs/1804.09066v2","paper_title":"ECO: Efficient Convolutional Network for Online Video Understanding","code":"https://github.com/mzolfaghari/ECO-efficient-video-understanding","n_code_links":6,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"NL I3D + GCN","metrics":{"Top 1 Accuracy":"46.1"},"uses_additional_data":false,"paper_date":"2018-06-05","paper":"/paper/videos-as-space-time-region-graphs","paper_url":"http://arxiv.org/abs/1806.01810v2","paper_title":"Videos as Space-Time Region Graphs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":69,"model":"NL I3D","metrics":{"Top 1 Accuracy":"44.4"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":70,"model":"Motion Feature Net","metrics":{"Top 1 Accuracy":"43.9"},"uses_additional_data":false,"paper_date":"2018-07-26","paper":"/paper/motion-feature-network-fixed-motion-filter","paper_url":"http://arxiv.org/abs/1807.10037v2","paper_title":"Motion Feature Network: Fixed Motion Filter for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":71,"model":"2-Stream TRN","metrics":{"Top 1 Accuracy":"42.01"},"uses_additional_data":false,"paper_date":"2017-11-22","paper":"/paper/temporal-relational-reasoning-in-videos","paper_url":"http://arxiv.org/abs/1711.08496v2","paper_title":"Temporal Relational Reasoning in Videos","code":"https://github.com/metalbubble/TRN-pytorch","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":72,"model":"HF-TSN (ImageNet pretraining)","metrics":{"Top 1 Accuracy":"41.97"},"uses_additional_data":true,"paper_date":"2019-05-29","paper":"/paper/hierarchical-feature-aggregation-networks-for","paper_url":"https://arxiv.org/abs/1905.12462v1","paper_title":"Hierarchical Feature Aggregation Networks for Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":73,"model":"MARS+RGB+Flow (16 frames, Kinetics pretrained)","metrics":{"Top 1 Accuracy":"40.4"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"M-TRN","metrics":{"Top 1 Accuracy":"34.4"},"uses_additional_data":false,"paper_date":"2017-11-22","paper":"/paper/temporal-relational-reasoning-in-videos","paper_url":"http://arxiv.org/abs/1711.08496v2","paper_title":"Temporal Relational Reasoning in Videos","code":"https://github.com/metalbubble/TRN-pytorch","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":35,"rows_with_any_sample_ran":33,"distinct_papers_with_graph_line":17,"distinct_papers_with_any_sample_ran":16,"samples_over_distinct_papers":{"n_ran":45,"n_unverified":36,"n_samples":81,"n_pointer_only_licence":19,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":85,"n_unverified":89,"n_samples":174,"n_pointer_only_licence":43,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}