{"url":"/sota/action-recognition-in-videos-on-something","task":{"name":"Action Recognition","url":"/task/action-recognition-in-videos","note":null},"dataset":{"name":"Something-Something V2","url":"/dataset/something-something-v2"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":"**Action Recognition** is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.\r\n\r\nIn the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos. \r\n\r\nPlease note some benchmarks may be located in the [Action Classification](https://paperswithcode.com/task/action-classification) or [Video Classification](https://paperswithcode.com/task/video-classification) tasks, e.g. Kinetics-400.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top-1 Accuracy","Top-5 Accuracy","Parameters","GFLOPs"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top-1 Accuracy":"higher","Top-5 Accuracy":"higher","Parameters":null,"GFLOPs":null}},"counts":{"rows":123,"rows_with_code":103,"rows_with_paper_page":123,"rows_dated":123,"rows_using_additional_data":70},"rows":[{"rank_in_archive_order":1,"model":"MVD (Kinetics400 pretrain, ViT-H, 16 frame)","metrics":{"GFLOPs":"1192x6","Parameters":"633","Top-1 Accuracy":"77.3","Top-5 Accuracy":"95.7"},"uses_additional_data":true,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":2,"model":"DejaVid","metrics":{"Top-1 Accuracy":"77.2","Top-5 Accuracy":"96.3"},"uses_additional_data":true,"paper_date":"2025-01-01","paper":"/paper/dejavid-encoder-agnostic-learned-temporal","paper_url":"http://openaccess.thecvf.com//content/CVPR2025/html/Ho_DejaVid_Encoder-Agnostic_Learned_Temporal_Matching_for_Video_Classification_CVPR_2025_paper.html","paper_title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","code":"https://github.com/darrylho/dejavid","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"InternVideo","metrics":{"Top-1 Accuracy":"77.2"},"uses_additional_data":true,"paper_date":"2022-12-06","paper":"/paper/internvideo-general-video-foundation-models","paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"InternVideo2-1B","metrics":{"Top-1 Accuracy":"77.1"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"VideoMAE V2-g","metrics":{"GFLOPs":"2544x6","Parameters":"1013","Top-1 Accuracy":"77.0","Top-5 Accuracy":"95.9"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"MVD (Kinetics400 pretrain, ViT-L, 16 frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"76.7","Top-5 Accuracy":"95.5"},"uses_additional_data":true,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":7,"model":"Hiera-L (no extra data)","metrics":{"Top-1 Accuracy":"76.5"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"TubeViT-L","metrics":{"Top-1 Accuracy":"76.1","Top-5 Accuracy":"95.2"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","code":"https://github.com/daniel-code/TubeViT","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"VideoMAE (no extra data, ViT-L, 32x2)","metrics":{"GFLOPs":"1436x3","Parameters":"305","Top-1 Accuracy":"75.4","Top-5 Accuracy":"95.2"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":10,"model":"Side4Video (EVA ViT-E/14)","metrics":{"Top-1 Accuracy":"75.2","Top-5 Accuracy":"94.0"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/side4video-spatial-temporal-side-network-for","paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":null},{"rank_in_archive_order":11,"model":"MaskFeat (Kinetics600 pretrain, MViT-L)","metrics":{"GFLOPs":"2828*3","Parameters":"218","Top-1 Accuracy":"75.0","Top-5 Accuracy":"95.0"},"uses_additional_data":true,"paper_date":"2021-12-16","paper":"/paper/masked-feature-prediction-for-self-supervised","paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","code":"https://github.com/facebookresearch/SlowFast","n_code_links":6,"syntology":null},{"rank_in_archive_order":12,"model":"MAR (50% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"276x6","Parameters":"311","Top-1 Accuracy":"74.7","Top-5 Accuracy":"94.9"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"ATM","metrics":{"Top-1 Accuracy":"74.6","Top-5 Accuracy":"94.4"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/what-can-simple-arithmetic-operations-do-for","paper_url":"https://arxiv.org/abs/2307.08908v2","paper_title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"MAWS (ViT-L)","metrics":{"Top-1 Accuracy":"74.4"},"uses_additional_data":true,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"VideoMAE (no extra data, ViT-L, 16frame)","metrics":{"GFLOPs":"597x6","Parameters":"305","Top-1 Accuracy":"74.3","Top-5 Accuracy":"94.6"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":16,"model":"MAR (75% mask, ViT-L, 16x4)","metrics":{"GFLOPs":"131x6","Parameters":"311","Top-1 Accuracy":"73.8","Top-5 Accuracy":"94.4"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"MVD (Kinetics400 pretrain, ViT-B, 16 frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.7","Top-5 Accuracy":"94.0"},"uses_additional_data":true,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":18,"model":"ViC-MAE (ViT-L)","metrics":{"Top-1 Accuracy":"73.7"},"uses_additional_data":false,"paper_date":"2023-03-21","paper":"/paper/visual-representation-learning-from-unlabeled","paper_url":"https://arxiv.org/abs/2303.12001v3","paper_title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","code":"https://github.com/jeffhernandez1995/vic-mae","n_code_links":2,"syntology":null},{"rank_in_archive_order":19,"model":"TAdaFormer-L/14","metrics":{"Top-1 Accuracy":"73.6"},"uses_additional_data":true,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":20,"model":"TDS-CLIP-ViT-L/14(8frames)","metrics":{"Top-1 Accuracy":"73.4","Top-5 Accuracy":"93.8"},"uses_additional_data":false,"paper_date":"2024-08-20","paper":"/paper/tds-clip-temporal-difference-side-network-for","paper_url":"https://arxiv.org/abs/2408.10688v1","paper_title":"TDS-CLIP: Temporal Difference Side Network for Image-to-Video Transfer Learning","code":"https://github.com/BBYL9413/TDS-CLIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"MViTv2-L (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"213.1","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":22,"model":"AMD(ViT-B/16)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"73.3","Top-5 Accuracy":"94.0"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"UniFormerV2-L","metrics":{"GFLOPs":"5154","Top-1 Accuracy":"73.0","Top-5 Accuracy":"94.5"},"uses_additional_data":true,"paper_date":"2022-09-22","paper":"/paper/uniformerv2-spatiotemporal-learning-by-arming","paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","code":"https://github.com/OpenGVLab/UniFormerV2","n_code_links":2,"syntology":null},{"rank_in_archive_order":24,"model":"ST-Adapter (ViT-L, CLIP)","metrics":{"GFLOPs":"8248","Top-1 Accuracy":"72.3","Top-5 Accuracy":"93.9"},"uses_additional_data":true,"paper_date":"2022-06-27","paper":"/paper/parameter-efficient-image-to-video-transfer","paper_url":"https://arxiv.org/abs/2206.13559v3","paper_title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","code":"https://github.com/linziyi96/st-adapter","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":0,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"ZeroI2V ViT-L/14","metrics":{"Top-1 Accuracy":"72.2","Top-5 Accuracy":"93.0"},"uses_additional_data":true,"paper_date":"2023-10-02","paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","code":"https://github.com/mcg-nju/zeroi2v","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"MViT-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"225x3","Top-1 Accuracy":"72.1"},"uses_additional_data":true,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":27,"model":"CAST(ViT-B/16)","metrics":{"Top-1 Accuracy":"71.6"},"uses_additional_data":false,"paper_date":"2023-11-30","paper":"/paper/cast-cross-attention-in-space-and-time-for-1","paper_url":"https://arxiv.org/abs/2311.18825v2","paper_title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","code":"https://github.com/khu-vll/cast","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":17}},{"rank_in_archive_order":28,"model":"StructVit-B-4-1","metrics":{"Top-1 Accuracy":"71.5"},"uses_additional_data":false,"paper_date":"2024-04-05","paper":"/paper/learning-correlation-structures-for-vision","paper_url":"https://arxiv.org/abs/2404.03924v1","paper_title":"Learning Correlation Structures for Vision Transformers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"OMNIVORE (Swin-B,  IN-21K+ Kinetics400 pretrain)","metrics":{"Top-1 Accuracy":"71.4","Top-5 Accuracy":"93.5"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":30,"model":"BEVT (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"71.4","Top-5 Accuracy":"-"},"uses_additional_data":true,"paper_date":"2021-12-02","paper":"/paper/bevt-bert-pretraining-of-video-transformers","paper_url":"https://arxiv.org/abs/2112.01529v3","paper_title":"BEVT: BERT Pretraining of Video Transformers","code":"https://github.com/xyzforever/bevt","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"UniFormer-B (IN-1K + Kinetics400 pretrain)","metrics":{"GFLOPs":"259x3","Parameters":"50.1","Top-1 Accuracy":"71.2","Top-5 Accuracy":"92.8"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/uniformer-unified-transformer-for-efficient","paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":32,"model":"TAdaConvNeXtV2-B","metrics":{"Top-1 Accuracy":"71.1"},"uses_additional_data":true,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"MAR (50% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"86x6","Parameters":"94","Top-1 Accuracy":"71.0","Top-5 Accuracy":"92.8"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"MVD (Kinetics400 pretrain, ViT-S, 16 frame)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.8"},"uses_additional_data":true,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":35,"model":"CoVeR(JFT-3B)","metrics":{"Top-1 Accuracy":"70.9","Top-5 Accuracy":"92.5"},"uses_additional_data":true,"paper_date":"2021-12-14","paper":"/paper/co-training-transformer-with-videos-and","paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"VideoMAE (no extra data, ViT-B, 16frame)","metrics":{"GFLOPs":"180x6","Parameters":"87","Top-1 Accuracy":"70.8","Top-5 Accuracy":"92.4"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":37,"model":"AMD(ViT-S/16)","metrics":{"GFLOPs":"57x6","Parameters":"22","Top-1 Accuracy":"70.2","Top-5 Accuracy":"92.5"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":38,"model":"ILA (ViT-L/14)","metrics":{"Top-1 Accuracy":"70.2","Top-5 Accuracy":"91.8"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/implicit-temporal-modeling-with-learnable","paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","code":"https://github.com/francis-rings/ila","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":39,"model":"MorphMLP-B (IN-1K)","metrics":{"GFLOPs":"197x3","Parameters":"68.5","Top-1 Accuracy":"70.1","Top-5 Accuracy":"92.8"},"uses_additional_data":true,"paper_date":"2021-11-24","paper":"/paper/morphmlp-a-self-attention-free-mlp-like","paper_url":"https://arxiv.org/abs/2111.12527v3","paper_title":"MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning","code":"https://github.com/liuruiyang98/Jittor-MLP","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"CoVeR(JFT-300M)","metrics":{"Top-1 Accuracy":"69.8","Top-5 Accuracy":"91.9"},"uses_additional_data":true,"paper_date":"2021-12-14","paper":"/paper/co-training-transformer-with-videos-and","paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":41,"model":"TPS","metrics":{"Top-1 Accuracy":"69.8"},"uses_additional_data":false,"paper_date":"2022-07-27","paper":"/paper/spatiotemporal-self-attention-modeling-with","paper_url":"https://arxiv.org/abs/2207.13259v1","paper_title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","code":"https://github.com/martinxm/tps","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"SIFA","metrics":{"Top-1 Accuracy":"69.8"},"uses_additional_data":false,"paper_date":"2022-06-14","paper":"/paper/stand-alone-inter-frame-attention-in-video-1","paper_url":"https://arxiv.org/abs/2206.06931v1","paper_title":"Stand-Alone Inter-Frame Attention in Video Models","code":"https://github.com/fuchenustc/sifa","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"Swin-B (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"321x3","Parameters":"89","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.7"},"uses_additional_data":true,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":13,"n_unverified":19,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"TDN ResNet101 (one clip, three crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x3","Top-1 Accuracy":"69.6","Top-5 Accuracy":"92.2"},"uses_additional_data":true,"paper_date":"2020-12-18","paper":"/paper/tdn-temporal-difference-networks-for","paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","code":"https://github.com/MCG-NJU/TDN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"MAR (75% mask, ViT-B, 16x4)","metrics":{"GFLOPs":"41x6","Parameters":"94","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.9"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"ORViT Mformer-L (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"69.5","Top-5 Accuracy":"91.5"},"uses_additional_data":true,"paper_date":"2021-10-13","paper":"/paper/object-region-video-transformers-1","paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","code":"https://github.com/eladb3/orvit","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":47,"model":"UniFormer-S (IN-1K + Kinetics600 pretrain)","metrics":{"GFLOPs":"41.8x3","Parameters":"21.4","Top-1 Accuracy":"69.4","Top-5 Accuracy":"92.1"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/uniformer-unified-transformer-for-efficient","paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":48,"model":"MML (ensemble)","metrics":{"Top-1 Accuracy":"69.02","Top-5 Accuracy":"92.70"},"uses_additional_data":true,"paper_date":"2020-11-04","paper":"/paper/mutual-modality-learning-for-video-action","paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","code":"https://github.com/papermsucode/mutual-modality-learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"MViT-B-24, 32x3","metrics":{"GFLOPs":"236x3","Parameters":"53.2M","Top-1 Accuracy":"68.7","Top-5 Accuracy":"91.5"},"uses_additional_data":true,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":50,"model":"MTV-B","metrics":{"Top-1 Accuracy":"68.5","Top-5 Accuracy":"90.4"},"uses_additional_data":true,"paper_date":"2022-01-12","paper":"/paper/multiview-transformers-for-video-recognition","paper_url":"https://arxiv.org/abs/2201.04288v4","paper_title":"Multiview Transformers for Video Recognition","code":"https://github.com/google-research/scenic","n_code_links":1,"syntology":null},{"rank_in_archive_order":51,"model":"MLP-3D","metrics":{"Top-1 Accuracy":"68.5"},"uses_additional_data":false,"paper_date":"2022-06-13","paper":"/paper/mlp-3d-a-mlp-like-3d-architecture-with-1","paper_url":"https://arxiv.org/abs/2206.06292v1","paper_title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"TDN ResNet101 (one clip, center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"GFLOPs":"198x1","Top-1 Accuracy":"68.2","Top-5 Accuracy":"91.6"},"uses_additional_data":true,"paper_date":"2020-12-18","paper":"/paper/tdn-temporal-difference-networks-for","paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","code":"https://github.com/MCG-NJU/TDN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"MSMA (8+16frames)","metrics":{"Top-1 Accuracy":"68.2"},"uses_additional_data":false,"paper_date":"2023-02-19","paper":"/paper/multi-scale-motion-aware-module-for-video","paper_url":"https://link.springer.com/chapter/10.1007/978-3-031-25075-0_40","paper_title":"Multi-scale Motion-Aware Module for Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":54,"model":"Mformer-L","metrics":{"GFLOPs":"1181x3","Parameters":"N/A","Top-1 Accuracy":"68.1","Top-5 Accuracy":"91.2"},"uses_additional_data":true,"paper_date":"2021-06-09","paper":"/paper/keeping-your-eye-on-the-ball-trajectory","paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","code":"https://github.com/facebookresearch/xformers","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":55,"model":"VIMPAC","metrics":{"Top-1 Accuracy":"68.1"},"uses_additional_data":true,"paper_date":"2021-06-21","paper":"/paper/vimpac-video-pre-training-via-masked-token","paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","code":"https://github.com/airsplay/vimpac","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":56,"model":"ORViT Mformer (ORViT blocks)","metrics":{"GFLOPs":"N/A","Parameters":"N/A","Top-1 Accuracy":"67.9","Top-5 Accuracy":"90.5"},"uses_additional_data":true,"paper_date":"2021-10-13","paper":"/paper/object-region-video-transformers-1","paper_url":"https://arxiv.org/abs/2110.06915v3","paper_title":"Object-Region Video Transformers","code":"https://github.com/eladb3/orvit","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":57,"model":"MViT-B, 32x3(Kinetics600 pretrain)","metrics":{"GFLOPs":"170x3","Parameters":"36.6","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.3"},"uses_additional_data":true,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":58,"model":"GC-TDN Ensemble (R50,8+16)","metrics":{"GFLOPs":"110.1","Parameters":"27.4","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.2"},"uses_additional_data":true,"paper_date":"2022-03-18","paper":"/paper/group-contextualization-for-video-recognition","paper_url":"https://arxiv.org/abs/2203.09694v1","paper_title":"Group Contextualization for Video Recognition","code":"https://github.com/haoyanbin918/group-contextualization","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"CT-Net Ensemble (R50, 8+12+16+24)","metrics":{"GFLOPs":"280","Parameters":"83.8","Top-1 Accuracy":"67.8","Top-5 Accuracy":"91.1"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/ct-net-channel-tensorization-network-for-1","paper_url":"https://arxiv.org/abs/2106.01603v1","paper_title":"CT-Net: Channel Tensorization Network for Video Classification","code":"https://github.com/Andy1621/CT-Net","n_code_links":1,"syntology":{"n_ran":11,"n_unverified":2,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"TCM (Ensemble)","metrics":{"Top-1 Accuracy":"67.8"},"uses_additional_data":false,"paper_date":"2022-02-24","paper":"/paper/slow-fast-visual-tempo-learning-for-video","paper_url":"https://arxiv.org/abs/2202.12116v2","paper_title":"Motion-driven Visual Tempo Learning for Video-based Action Recognition","code":"https://github.com/yzfly/tcm","n_code_links":2,"syntology":null},{"rank_in_archive_order":61,"model":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":62,"model":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips","metrics":{"Top-1 Accuracy":"67.7","Top-5 Accuracy":"91.1"},"uses_additional_data":true,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":63,"model":"GTDNet","metrics":{"Top-1 Accuracy":"67.6"},"uses_additional_data":false,"paper_date":"2022-11-23","paper":"/paper/global-temporal-difference-network-for-action","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9961904","paper_title":"Global Temporal Difference Network for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":64,"model":"SELFYNet-TSM-R50En (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.4","Top-5 Accuracy":"91"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":65,"model":"VoV3D-L (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"67.35","Top-5 Accuracy":"90.50"},"uses_additional_data":true,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"PLAR","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"91"},"uses_additional_data":false,"paper_date":"2023-05-21","paper":"/paper/prompt-learning-for-action-recognition","paper_url":"https://arxiv.org/abs/2305.12437v4","paper_title":"SCP: Soft Conditional Prompt Learning for Aerial Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":67,"model":"RSANet-R50 (8+16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"67.3","Top-5 Accuracy":"90.8"},"uses_additional_data":true,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":68,"model":"X-Vit (x16)","metrics":{"GFLOPs":"850x1","Parameters":"N/A","Top-1 Accuracy":"67.2","Top-5 Accuracy":"90.8"},"uses_additional_data":true,"paper_date":"2021-06-10","paper":"/paper/space-time-mixing-attention-for-video","paper_url":"https://arxiv.org/abs/2106.05968v2","paper_title":"Space-time Mixing Attention for Video Transformer","code":"https://github.com/1adrianb/video-transformers","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"TAda2D-En (ResNet-50, 8+16 frames)","metrics":{"Top-1 Accuracy":"67.2","Top-5 Accuracy":"89.8"},"uses_additional_data":true,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":70,"model":"Mformer-HR","metrics":{"GFLOPs":"958.8x3","Parameters":"N/A","Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.6"},"uses_additional_data":true,"paper_date":"2021-06-09","paper":"/paper/keeping-your-eye-on-the-ball-trajectory","paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","code":"https://github.com/facebookresearch/xformers","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":71,"model":"TAdaConvNeXt-T","metrics":{"Top-1 Accuracy":"67.1","Top-5 Accuracy":"90.4"},"uses_additional_data":true,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"MoDS (8+16frames)","metrics":{"Top-1 Accuracy":"67.1"},"uses_additional_data":false,"paper_date":"2022-07-15","paper":"/paper/action-recognition-with-motion","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=9831068","paper_title":"Action Recognition With Motion Diversification and Dynamic Selection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":73,"model":"STPG (8+16frames)","metrics":{"Top-1 Accuracy":"67.0"},"uses_additional_data":false,"paper_date":"2022-08-09","paper":"/paper/spatial-temporal-pyramid-graph-reasoning-for","paper_url":"https://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=9852978","paper_title":"Spatial-Temporal Pyramid Graph Reasoning for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":74,"model":"MML (single)","metrics":{"Top-1 Accuracy":"66.83","Top-5 Accuracy":"91.30"},"uses_additional_data":true,"paper_date":"2020-11-04","paper":"/paper/mutual-modality-learning-for-video-action","paper_url":"https://arxiv.org/abs/2011.02543v1","paper_title":"Mutual Modality Learning for Video Action Classification","code":"https://github.com/papermsucode/mutual-modality-learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":75,"model":"ILA (ViT-B/16)","metrics":{"Top-1 Accuracy":"66.8","Top-5 Accuracy":"90.3"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/implicit-temporal-modeling-with-learnable","paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","code":"https://github.com/francis-rings/ila","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":76,"model":"TSM (RGB + Flow)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"91.3"},"uses_additional_data":true,"paper_date":"2018-11-20","paper":"/paper/temporal-shift-module-for-efficient-video","paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":13,"syntology":{"n_ran":6,"n_unverified":10,"n_samples":16,"n_pointer_only_licence":4}},{"rank_in_archive_order":77,"model":"MSNet-R50En (8+16 ensemble, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"66.6","Top-5 Accuracy":"90.6"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"PAN ResNet101 (RGB only, no Flow)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.6"},"uses_additional_data":true,"paper_date":"2020-08-08","paper":"/paper/pan-towards-fast-action-recognition-via","paper_url":"https://arxiv.org/abs/2008.03462v1","paper_title":"PAN: Towards Fast Action Recognition via Learning Persistence of Appearance","code":"https://github.com/zhang-can/PAN-PyTorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":79,"model":"TSM+W3 (16 frames, RGB ResNet-50)","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.4"},"uses_additional_data":true,"paper_date":"2020-04-02","paper":"/paper/knowing-what-where-and-when-to-look-efficient","paper_url":"https://arxiv.org/abs/2004.01278v1","paper_title":"Knowing What, Where and When to Look: Efficient Video Action Modeling with Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":80,"model":"Mformer","metrics":{"Top-1 Accuracy":"66.5","Top-5 Accuracy":"90.1"},"uses_additional_data":true,"paper_date":"2021-06-09","paper":"/paper/keeping-your-eye-on-the-ball-trajectory","paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","code":"https://github.com/facebookresearch/xformers","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":81,"model":"MVFNet-ResNet50 (center crop, 8+16 ensemble, ImageNet pretrained, RGB only)","metrics":{"Top-1 Accuracy":"66.3"},"uses_additional_data":true,"paper_date":"2020-12-13","paper":"/paper/mvfnet-multi-view-fusion-network-for","paper_url":"https://arxiv.org/abs/2012.06977v2","paper_title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","code":"https://github.com/whwu95/MVFNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":82,"model":"MViT-B, 16x4","metrics":{"Top-1 Accuracy":"66.2","Top-5 Accuracy":"90.2"},"uses_additional_data":true,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":83,"model":"RSANet-R50 (16 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"66","Top-5 Accuracy":"89.8"},"uses_additional_data":true,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":84,"model":"VoV3D-L (32frames, from scratch, single)","metrics":{"GFLOPs":"20.9x6","Parameters":"5.8M","Top-1 Accuracy":"65.8","Top-5 Accuracy":"89.5"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":85,"model":"E3D-L","metrics":{"GFLOPs":"18.3","Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"uses_additional_data":false,"paper_date":"2023-03-05","paper":"/paper/maximizing-spatio-temporal-entropy-of-deep-3d","paper_url":"https://arxiv.org/abs/2303.02693v1","paper_title":"Maximizing Spatio-Temporal Entropy of Deep 3D CNNs for Efficient Video Recognition","code":"https://github.com/alibaba/lightweight-neural-architecture-search","n_code_links":1,"syntology":null},{"rank_in_archive_order":86,"model":"SELFYNet-TSM-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"65.7","Top-5 Accuracy":"89.8"},"uses_additional_data":true,"paper_date":"2021-02-14","paper":"/paper/learning-self-similarity-in-space-and-time-as-1","paper_url":"https://arxiv.org/abs/2102.07092v3","paper_title":"Learning Self-Similarity in Space and Time as Generalized Motion for Video Action Recognition","code":"https://github.com/arunos728/SELFY","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":87,"model":"TAda2D (ResNet-50, 16 frames)","metrics":{"Top-1 Accuracy":"65.6","Top-5 Accuracy":"89.2"},"uses_additional_data":true,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":88,"model":"ViViT-L/16x2 Fact. encoder","metrics":{"Top-1 Accuracy":"65.4","Top-5 Accuracy":"89.8"},"uses_additional_data":true,"paper_date":"2021-03-29","paper":"/paper/2103-15691","paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","code":"https://github.com/google-research/scenic","n_code_links":10,"syntology":{"n_ran":14,"n_unverified":7,"n_samples":21,"n_pointer_only_licence":1}},{"rank_in_archive_order":89,"model":"VoV3D-M (32frames, Kinetics pretrained, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"65.24","Top-5 Accuracy":"89.48"},"uses_additional_data":true,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":90,"model":"bLVNet","metrics":{"Top-1 Accuracy":"65.2"},"uses_additional_data":true,"paper_date":"2019-12-02","paper":"/paper/more-is-less-learning-efficient-video-1","paper_url":"https://arxiv.org/abs/1912.00869v1","paper_title":"More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation","code":"https://github.com/IBM/bLVNet-TAM","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":91,"model":"DirecFormer","metrics":{"Top-1 Accuracy":"64.94","Top-5 Accuracy":"87.9"},"uses_additional_data":false,"paper_date":"2022-03-19","paper":"/paper/direcformer-a-directed-attention-in","paper_url":"https://arxiv.org/abs/2203.10233v1","paper_title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","code":"https://github.com/uark-cviu/direcformer","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":92,"model":"RSANet-R50 (8 frames, ImageNet pretrained, a single clip)","metrics":{"Top-1 Accuracy":"64.8","Top-5 Accuracy":"89.1"},"uses_additional_data":true,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":93,"model":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"64.7","Top-5 Accuracy":"89.4"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"AK-Net","metrics":{"Top-1 Accuracy":"64.3"},"uses_additional_data":false,"paper_date":"2022-01-17","paper":"/paper/action-keypoint-network-for-efficient-video","paper_url":"https://arxiv.org/abs/2201.06304v1","paper_title":"Action Keypoint Network for Efficient Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":95,"model":"VoV3D-M (32frames, from scratch, single)","metrics":{"GFLOPs":"11.5x6","Parameters":"3.3M","Top-1 Accuracy":"64.2","Top-5 Accuracy":"88.8"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":96,"model":"VoV3D-L (16frames, from scratch, single)","metrics":{"GFLOPs":"9.3x6","Parameters":"5.8M","Top-1 Accuracy":"64.1","Top-5 Accuracy":"88.6"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"TAda2D (ResNet-50, 8 frames)","metrics":{"Top-1 Accuracy":"64.0","Top-5 Accuracy":"88.0"},"uses_additional_data":true,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"MoViNet-A2","metrics":{"GFLOPs":"10.3x1","Parameters":"4.8M","Top-1 Accuracy":"63.5","Top-5 Accuracy":"89.0"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":99,"model":"VoV3D-M (16frames, from scratch, single)","metrics":{"GFLOPs":"5.7x6","Parameters":"3.3M","Top-1 Accuracy":"63.2","Top-5 Accuracy":"88.2"},"uses_additional_data":false,"paper_date":"2020-12-01","paper":"/paper/diverse-temporal-aggregation-and-depthwise","paper_url":"https://arxiv.org/abs/2012.00317v3","paper_title":"Diverse Temporal Aggregation and Depthwise Spatiotemporal Factorization for Efficient Video Classification","code":"https://github.com/youngwanLEE/VoV3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":100,"model":"MSNet-R50 (8 frames, ImageNet pretrained)","metrics":{"Top-1 Accuracy":"63","Top-5 Accuracy":"88.4"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"MoViNet-A1","metrics":{"GFLOPs":"6.0x1","Parameters":"4.6M","Top-1 Accuracy":"62.7","Top-5 Accuracy":"89.0"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":102,"model":"OmniVL","metrics":{"Top-1 Accuracy":"62.5","Top-5 Accuracy":"86.2"},"uses_additional_data":false,"paper_date":"2022-09-15","paper":"/paper/omnivl-one-foundation-model-for-image","paper_url":"https://arxiv.org/abs/2209.07526v2","paper_title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":103,"model":"TimeSformer-HR","metrics":{"Top-1 Accuracy":"62.5"},"uses_additional_data":true,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":104,"model":"TimeSformer-L","metrics":{"Top-1 Accuracy":"62.3"},"uses_additional_data":true,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":105,"model":"TRG (ResNet-50)","metrics":{"Top-1 Accuracy":"62.2","Top-5 Accuracy":"90.3"},"uses_additional_data":false,"paper_date":"2019-08-27","paper":"/paper/temporal-reasoning-graph-for-activity","paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":106,"model":"TPN (TSM-50)","metrics":{"Top-1 Accuracy":"62.0"},"uses_additional_data":false,"paper_date":"2020-04-07","paper":"/paper/temporal-pyramid-network-for-action","paper_url":"https://arxiv.org/abs/2004.03548v2","paper_title":"Temporal Pyramid Network for Action Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":107,"model":"Multigrid","metrics":{"Top-1 Accuracy":"61.7"},"uses_additional_data":true,"paper_date":"2019-12-02","paper":"/paper/a-multigrid-method-for-efficiently-training","paper_url":"https://arxiv.org/abs/1912.00998v2","paper_title":"A Multigrid Method for Efficiently Training Video Models","code":"https://github.com/facebookresearch/SlowFast","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":3}},{"rank_in_archive_order":108,"model":"SlowFast","metrics":{"Top-1 Accuracy":"61.7"},"uses_additional_data":true,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":109,"model":"TRG (Inception-V3)","metrics":{"Top-1 Accuracy":"61.3","Top-5 Accuracy":"91.4"},"uses_additional_data":false,"paper_date":"2019-08-27","paper":"/paper/temporal-reasoning-graph-for-activity","paper_url":"https://arxiv.org/abs/1908.09995v1","paper_title":"Temporal Reasoning Graph for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":110,"model":"MoViNet-A0","metrics":{"GFLOPs":"2.7x1","Parameters":"3.1M","Top-1 Accuracy":"61.3","Top-5 Accuracy":"88.2"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":111,"model":"CCS + two-stream + TRN","metrics":{"Top-1 Accuracy":"61.2","Top-5 Accuracy":"89.3"},"uses_additional_data":false,"paper_date":"2019-08-27","paper":"/paper/cooperative-cross-stream-network-for","paper_url":"https://arxiv.org/abs/1908.10136v1","paper_title":"Cooperative Cross-Stream Network for Discriminative Action Representation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":112,"model":"VidTr-L","metrics":{"Top-1 Accuracy":"60.2"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":113,"model":"TimeSformer","metrics":{"Top-1 Accuracy":"59.5"},"uses_additional_data":true,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":114,"model":"SVT","metrics":{"Top-1 Accuracy":"59.2"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/self-supervised-video-transformer","paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","code":"https://github.com/kahnchana/svt","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":115,"model":"TAM (5-shot)","metrics":{"Top-1 Accuracy":"52.3"},"uses_additional_data":false,"paper_date":"2019-06-27","paper":"/paper/few-shot-video-classification-via-temporal","paper_url":"https://arxiv.org/abs/1906.11415v1","paper_title":"Few-Shot Video Classification via Temporal Alignment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":116,"model":"model3D_1 with left-right augmentation and fps jitter","metrics":{"Top-1 Accuracy":"51.33","Top-5 Accuracy":"80.46"},"uses_additional_data":false,"paper_date":"2017-06-13","paper":"/paper/the-something-something-video-database-for","paper_url":"http://arxiv.org/abs/1706.04261v2","paper_title":"The \"something something\" video database for learning and evaluating visual common sense","code":"https://github.com/jayleicn/singularity","n_code_links":5,"syntology":null},{"rank_in_archive_order":117,"model":"Prob-Distill","metrics":{"Top-1 Accuracy":"49.9","Top-5 Accuracy":"79.1"},"uses_additional_data":false,"paper_date":"2019-04-05","paper":"/paper/paying-more-attention-to-motion-attention","paper_url":"https://arxiv.org/abs/1904.03249v2","paper_title":"Attention Distillation for Learning Video Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":118,"model":"STM + TRNMultiscale","metrics":{"Top-1 Accuracy":"47.73"},"uses_additional_data":false,"paper_date":"2019-09-11","paper":"/paper/comparative-analysis-of-cnn-based","paper_url":"https://arxiv.org/abs/1909.05165v2","paper_title":"Comparative Analysis of CNN-based Spatiotemporal Reasoning in Videos","code":"https://github.com/fubel/stmodeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":119,"model":"InternVideo2-6B","metrics":{"GFLOPs":"13321","Parameters":"2131","Top-1 Accuracy":"1","Top-5 Accuracy":"12"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":120,"model":"MViTv2-B (IN-21K + Kinetics400 pretrain)","metrics":{"Parameters":"51.1","Top-5 Accuracy":"93.4"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":121,"model":"RSANet-R50 (8+16 frames, ImageNet pretrained, 2 clips)","metrics":{"Top-5 Accuracy":"91.1"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/relational-self-attention-what-s-missing-in","paper_url":"https://arxiv.org/abs/2111.01673v1","paper_title":"Relational Self-Attention: What's Missing in Attention for Video Understanding","code":"https://github.com/KimManjin/RSA","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":122,"model":"MoViNet-A3","metrics":{"GFLOPs":"23.7x1","Parameters":"5.3M"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":123,"model":"MViT-L (IN-21K + Kinetics400 pretrain)","metrics":{"GFLOPs":"2828x3"},"uses_additional_data":true,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,821 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6821,"papers_extracted_not_yet_verified":65,"boards_without_verdict":29,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":63,"rows_with_any_sample_ran":55,"distinct_papers_with_graph_line":37,"distinct_papers_with_any_sample_ran":32,"samples_over_distinct_papers":{"n_ran":187,"n_unverified":127,"n_samples":314,"n_pointer_only_licence":84,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":363,"n_unverified":206,"n_samples":569,"n_pointer_only_licence":173,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}