{"url":"/sota/action-classification-on-kinetics-400","task":{"name":"Action Classification","url":"/task/action-classification","note":null},"dataset":{"name":"Kinetics-400","url":"/dataset/kinetics"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"Image source: [The Kinetics Human Action Video Dataset](https://arxiv.org/pdf/1705.06950.pdf)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Acc@1","Acc@5","FLOPs (G) x views","Clip acc@1","Parameters (M)","Clip acc@5"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Acc@1":"higher","Acc@5":"higher","FLOPs (G) x views":"lower","Clip acc@1":"higher","Parameters (M)":null,"Clip acc@5":"higher"}},"counts":{"rows":207,"rows_with_code":179,"rows_with_paper_page":207,"rows_dated":207,"rows_using_additional_data":10},"rows":[{"rank_in_archive_order":1,"model":"OmniVec2","metrics":{"Acc@1":"93.6"},"uses_additional_data":false,"paper_date":"2024-01-01","paper":"/paper/omnivec2-a-novel-transformer-based-network","paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"FTP-UniFormerV2-L/14","metrics":{"Acc@1":"93.4"},"uses_additional_data":false,"paper_date":"2024-03-24","paper":"/paper/enhancing-video-transformers-for-action","paper_url":"https://arxiv.org/abs/2403.16128v1","paper_title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":3,"model":"InternVideo2-6B","metrics":{"Acc@1":"92.1"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":4,"model":"InternVideo2-1B","metrics":{"Acc@1":"91.6"},"uses_additional_data":true,"paper_date":"2024-03-22","paper":"/paper/internvideo2-scaling-video-foundation-models","paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"InternVideo","metrics":{"Acc@1":"91.1"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/internvideo-general-video-foundation-models","paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","code":"https://github.com/opengvlab/internvideo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"OmniVec","metrics":{"Acc@1":"91.1"},"uses_additional_data":false,"paper_date":"2023-11-07","paper":"/paper/omnivec-learning-robust-representations-with","paper_url":"https://arxiv.org/abs/2311.05709v1","paper_title":"OmniVec: Learning robust representations with cross modal sharing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":7,"model":"TubeViT-H (ImageNet-1k)","metrics":{"Acc@1":"90.9","Acc@5":"98.9","FLOPs (G) x views":"176400x4x3","Parameters (M)":"632"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","code":"https://github.com/daniel-code/TubeViT","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"Unmasked Teacher (ViT-L)","metrics":{"Acc@1":"90.6","Acc@5":"98.7","FLOPs (G) x views":"1434×3×4","Parameters (M)":"304"},"uses_additional_data":false,"paper_date":"2023-03-28","paper":"/paper/unmasked-teacher-towards-training-efficient","paper_url":"https://arxiv.org/abs/2303.16058v2","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","code":"https://github.com/opengvlab/unmasked_teacher","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"UMT-L (ViT-L/16)","metrics":{"Acc@1":"90.6","Acc@5":"98.7"},"uses_additional_data":false,"paper_date":"2023-03-28","paper":"/paper/unmasked-teacher-towards-training-efficient","paper_url":"https://arxiv.org/abs/2303.16058v2","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","code":"https://github.com/opengvlab/unmasked_teacher","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"TubeVit-L (ImageNet-1k)","metrics":{"Acc@1":"90.2","Acc@5":"98.6","FLOPs (G) x views":"95300x4x3","Parameters (M)":"307"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","code":"https://github.com/daniel-code/TubeViT","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"UniFormerV2-L (ViT-L, 336)","metrics":{"Acc@1":"90.0","Acc@5":"98.4","FLOPs (G) x views":"75300x3x2","Parameters (M)":"354"},"uses_additional_data":true,"paper_date":"2022-09-22","paper":"/paper/uniformerv2-spatiotemporal-learning-by-arming","paper_url":"https://openreview.net/forum?id=d77RVuVg-Mf","paper_title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","code":"https://github.com/OpenGVLab/UniFormerV2","n_code_links":2,"syntology":null},{"rank_in_archive_order":12,"model":"VideoMAE V2-g (64x266x266)","metrics":{"Acc@1":"90.0","Acc@5":"98.4"},"uses_additional_data":false,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"FluxViT-B","metrics":{"Acc@1":"90.0","FLOPs (G) x views":"440x3x4","Parameters (M)":"97"},"uses_additional_data":true,"paper_date":"2025-03-18","paper":"/paper/make-your-training-flexible-towards","paper_url":"https://arxiv.org/abs/2503.14237v1","paper_title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","code":"https://github.com/opengvlab/fluxvit","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"MTV-H (WTS 60M)","metrics":{"Acc@1":"89.9","Acc@5":"98.3","FLOPs (G) x views":"735700x4x3"},"uses_additional_data":false,"paper_date":"2022-01-12","paper":"/paper/multiview-transformers-for-video-recognition","paper_url":"https://arxiv.org/abs/2201.04288v4","paper_title":"Multiview Transformers for Video Recognition","code":"https://github.com/google-research/scenic","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"TAdaFormer-L/14","metrics":{"Acc@1":"89.9"},"uses_additional_data":false,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"EVA","metrics":{"Acc@1":"89.7"},"uses_additional_data":false,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"AM/12 ViT-B Dinov2","metrics":{"Acc@1":"89.6"},"uses_additional_data":false,"paper_date":"2024-11-04","paper":"/paper/am-flow-adapters-for-temporal-processing-in","paper_url":"https://arxiv.org/abs/2411.02065v1","paper_title":"AM Flow: Adapters for Temporal Processing in Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":18,"model":"ATM","metrics":{"Acc@1":"89.4","Acc@5":"98.3"},"uses_additional_data":false,"paper_date":"2023-07-18","paper":"/paper/what-can-simple-arithmetic-operations-do-for","paper_url":"https://arxiv.org/abs/2307.08908v2","paper_title":"What Can Simple Arithmetic Operations Do for Temporal Modeling?","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"DejaVid","metrics":{"Acc@1":"89.1","Acc@5":"98.2"},"uses_additional_data":true,"paper_date":"2025-01-01","paper":"/paper/dejavid-encoder-agnostic-learned-temporal","paper_url":"http://openaccess.thecvf.com//content/CVPR2025/html/Ho_DejaVid_Encoder-Agnostic_Learned_Temporal_Matching_for_Video_Classification_CVPR_2025_paper.html","paper_title":"DejaVid: Encoder-Agnostic Learned Temporal Matching for Video Classification","code":"https://github.com/darrylho/dejavid","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"CoCa (finetuned)","metrics":{"Acc@1":"88.9"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"BIKE (CLIP ViT-L/14)","metrics":{"Acc@1":"88.7","Acc@5":"98.4"},"uses_additional_data":false,"paper_date":"2022-12-31","paper":"/paper/bidirectional-cross-modal-knowledge","paper_url":"https://arxiv.org/abs/2301.00182v2","paper_title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":22,"model":"ILA (ViT-L/14)","metrics":{"Acc@1":"88.7","Acc@5":"97.8"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/implicit-temporal-modeling-with-learnable","paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","code":"https://github.com/francis-rings/ila","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":23,"model":"Side4Video (EVA, ViT-E/14)","metrics":{"Acc@1":"88.6","Acc@5":"98.2"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/side4video-spatial-temporal-side-network-for","paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","code":"https://github.com/whwu95/ATM","n_code_links":2,"syntology":null},{"rank_in_archive_order":24,"model":"TubeVit-B (ImageNet-1k)","metrics":{"Acc@1":"88.6","Acc@5":"97.6","FLOPs (G) x views":"8700x3x4","Parameters (M)":"86"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","code":"https://github.com/daniel-code/TubeViT","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"VideoMAE V2-g","metrics":{"Acc@1":"88.5","Acc@5":"98.1"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"ONE-PEACE","metrics":{"Acc@1":"88.1","Acc@5":"97.8"},"uses_additional_data":false,"paper_date":"2023-05-18","paper":"/paper/one-peace-exploring-one-general","paper_url":"https://arxiv.org/abs/2305.11172v1","paper_title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","code":"https://github.com/modelscope/modelscope","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"FluxViT-S","metrics":{"Acc@1":"88.0","FLOPs (G) x views":"154x3x4","Parameters (M)":"24"},"uses_additional_data":true,"paper_date":"2025-03-18","paper":"/paper/make-your-training-flexible-towards","paper_url":"https://arxiv.org/abs/2503.14237v1","paper_title":"Make Your Training Flexible: Towards Deployment-Efficient Video Models","code":"https://github.com/opengvlab/fluxvit","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":10,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"CoCa (frozen)","metrics":{"Acc@1":"88.0"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"ViT-22B","metrics":{"Acc@1":"88.0"},"uses_additional_data":false,"paper_date":"2023-02-10","paper":"/paper/scaling-vision-transformers-to-22-billion","paper_url":"https://arxiv.org/abs/2302.05442v1","paper_title":"Scaling Vision Transformers to 22 Billion Parameters","code":"https://github.com/lucidrains/flash-cosine-sim-attention","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"Text4Vis (CLIP ViT-L/14)","metrics":{"Acc@1":"87.8","Acc@5":"97.6"},"uses_additional_data":false,"paper_date":"2022-07-04","paper":"/paper/transferring-textual-knowledge-for-visual","paper_url":"https://arxiv.org/abs/2207.01297v4","paper_title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":31,"model":"Hiera-H (no extra data)","metrics":{"Acc@1":"87.8"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"EVL (CLIP ViT-L/14@336px, frozen, 32 frames)","metrics":{"Acc@1":"87.7","Acc@5":"97.8"},"uses_additional_data":false,"paper_date":"2022-08-06","paper":"/paper/frozen-clip-models-are-efficient-video","paper_url":"https://arxiv.org/abs/2208.03550v1","paper_title":"Frozen CLIP Models are Efficient Video Learners","code":"https://github.com/opengvlab/efficient-video-recognition","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":5,"n_samples":10,"n_pointer_only_licence":10}},{"rank_in_archive_order":33,"model":"DualPath w/ ViT-L/14","metrics":{"Acc@1":"87.7","Acc@5":"97.8"},"uses_additional_data":false,"paper_date":"2023-03-17","paper":"/paper/dual-path-adaptation-from-image-to-video","paper_url":"https://arxiv.org/abs/2303.09857v1","paper_title":"Dual-path Adaptation from Image to Video Transformers","code":"https://github.com/park-jungin/dualpath","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"X-CLIP(ViT-L/14, CLIP)","metrics":{"Acc@1":"87.7","Acc@5":"97.4"},"uses_additional_data":false,"paper_date":"2022-08-04","paper":"/paper/expanding-language-image-pretrained-models","paper_url":"https://arxiv.org/abs/2208.02816v1","paper_title":"Expanding Language-Image Pretrained Models for General Video Recognition","code":"https://github.com/microsoft/videox","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":35,"model":"AIM (CLIP ViT-L/14, 32x224)","metrics":{"Acc@1":"87.5","Acc@5":"97.7"},"uses_additional_data":true,"paper_date":"2023-02-06","paper":"/paper/aim-adapting-image-models-for-efficient-video","paper_url":"https://arxiv.org/abs/2302.03024v1","paper_title":"AIM: Adapting Image Models for Efficient Video Action Recognition","code":"https://github.com/taoyang1122/adapt-image-models","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"VideoMAE (no extra data, ViT-H, 32x320x320)","metrics":{"Acc@1":"87.4","Acc@5":"97.6"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":37,"model":"ST-Adapter (ViT-L, CLIP)","metrics":{"Acc@1":"87.2","Acc@5":"97.6"},"uses_additional_data":false,"paper_date":"2022-06-27","paper":"/paper/parameter-efficient-image-to-video-transfer","paper_url":"https://arxiv.org/abs/2206.13559v3","paper_title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","code":"https://github.com/linziyi96/st-adapter","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":6,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"ZeroI2V ViT-L/14","metrics":{"Acc@1":"87.2","Acc@5":"97.6"},"uses_additional_data":false,"paper_date":"2023-10-02","paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","code":"https://github.com/mcg-nju/zeroi2v","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"CoVeR (JFT-3B)","metrics":{"Acc@1":"87.2","Acc@5":"97.5"},"uses_additional_data":false,"paper_date":"2021-12-14","paper":"/paper/co-training-transformer-with-videos-and","paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"MVD (K400 pretrain, ViT-H, 16x224x224)","metrics":{"Acc@1":"87.2","Acc@5":"97.4"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":41,"model":"mPLUG-2","metrics":{"Acc@1":"87.1","Acc@5":"97.7"},"uses_additional_data":false,"paper_date":"2023-02-01","paper":"/paper/mplug-2-a-modularized-multi-modal-foundation","paper_url":"https://arxiv.org/abs/2302.00402v1","paper_title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","code":"https://github.com/modelscope/modelscope","n_code_links":4,"syntology":{"n_ran":9,"n_unverified":10,"n_samples":19,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"MaskFeat (K600, MViT-L)","metrics":{"Acc@1":"87.0","Acc@5":"97.4"},"uses_additional_data":false,"paper_date":"2021-12-16","paper":"/paper/masked-feature-prediction-for-self-supervised","paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","code":"https://github.com/facebookresearch/SlowFast","n_code_links":6,"syntology":null},{"rank_in_archive_order":43,"model":"VicTR (ViT-L/14)","metrics":{"Acc@1":"87.0"},"uses_additional_data":false,"paper_date":"2023-04-05","paper":"/paper/victr-video-conditioned-text-representations","paper_url":"https://arxiv.org/abs/2304.02560v2","paper_title":"VicTR: Video-conditioned Text Representations for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"Video-SwinV2-G (ImageNet-22k and external 70M pretrain)","metrics":{"Acc@1":"86.8"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":45,"model":"MaskFeat (no extra data, MViT-L)","metrics":{"Acc@1":"86.7","Acc@5":"97.3"},"uses_additional_data":false,"paper_date":"2021-12-16","paper":"/paper/masked-feature-prediction-for-self-supervised","paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","code":"https://github.com/facebookresearch/SlowFast","n_code_links":6,"syntology":null},{"rank_in_archive_order":46,"model":"VideoMAE (no extra data, ViT-H)","metrics":{"Acc@1":"86.6","Acc@5":"97.1"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":47,"model":"MVD (K400 pretrain, ViT-L, 16x224x224)","metrics":{"Acc@1":"86.4","Acc@5":"97.0"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":48,"model":"TAdaConvNeXtV2-B","metrics":{"Acc@1":"86.4"},"uses_additional_data":false,"paper_date":"2023-08-10","paper":"/paper/temporally-adaptive-models-for-efficient","paper_url":"https://arxiv.org/abs/2308.05787v1","paper_title":"Temporally-Adaptive Models for Efficient Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"CoVeR (JFT-300M)","metrics":{"Acc@1":"86.3","Acc@5":"97.2"},"uses_additional_data":false,"paper_date":"2021-12-14","paper":"/paper/co-training-transformer-with-videos-and","paper_url":"https://arxiv.org/abs/2112.07175v1","paper_title":"Co-training Transformer with Videos and Images Improves Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":50,"model":"VideoMAE (no extra data, ViT-L, 32x320x320)","metrics":{"Acc@1":"86.1","Acc@5":"97.3"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":51,"model":"MViTv2-L (ImageNet-21k pretrain)","metrics":{"Acc@1":"86.1","Acc@5":"97.0"},"uses_additional_data":true,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":52,"model":"ILA (ViT-B/16)","metrics":{"Acc@1":"85.7","Acc@5":"97.2"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/implicit-temporal-modeling-with-learnable","paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","code":"https://github.com/francis-rings/ila","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":53,"model":"DualPath w/ ViT-B/16","metrics":{"Acc@1":"85.4","Acc@5":"97.1"},"uses_additional_data":false,"paper_date":"2023-03-17","paper":"/paper/dual-path-adaptation-from-image-to-video","paper_url":"https://arxiv.org/abs/2303.09857v1","paper_title":"Dual-path Adaptation from Image to Video Transformers","code":"https://github.com/park-jungin/dualpath","n_code_links":1,"syntology":null},{"rank_in_archive_order":54,"model":"TokenLearner 16at18 (L/10)","metrics":{"Acc@1":"85.4"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_url":"https://arxiv.org/abs/2106.11297v4","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","code":"https://github.com/google-research/scenic","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":55,"model":"MAR (50% mask, ViT-L, 16x4)","metrics":{"Acc@1":"85.3","Acc@5":"96.3"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"CAST(ViT-B/16)","metrics":{"Acc@1":"85.3"},"uses_additional_data":false,"paper_date":"2023-11-30","paper":"/paper/cast-cross-attention-in-space-and-time-for-1","paper_url":"https://arxiv.org/abs/2311.18825v2","paper_title":"CAST: Cross-Attention in Space and Time for Video Action Recognition","code":"https://github.com/khu-vll/cast","n_code_links":1,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":17}},{"rank_in_archive_order":57,"model":"VideoMAE (no extra data, ViT-L, 16x4)","metrics":{"Acc@1":"85.2","Acc@5":"96.8"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":58,"model":"ViC-MAE (ViT-L)","metrics":{"Acc@1":"85.1"},"uses_additional_data":false,"paper_date":"2023-03-21","paper":"/paper/visual-representation-learning-from-unlabeled","paper_url":"https://arxiv.org/abs/2303.12001v3","paper_title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","code":"https://github.com/jeffhernandez1995/vic-mae","n_code_links":2,"syntology":null},{"rank_in_archive_order":59,"model":"VideoMamba-M800","metrics":{"Acc@1":"85.0"},"uses_additional_data":false,"paper_date":"2024-03-11","paper":"/paper/videomamba-state-space-model-for-efficient","paper_url":"https://arxiv.org/abs/2403.06977v2","paper_title":"VideoMamba: State Space Model for Efficient Video Understanding","code":"https://github.com/opengvlab/videomamba","n_code_links":2,"syntology":{"n_ran":9,"n_unverified":6,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"Swin-L (384x384, ImageNet-21k pretrain)","metrics":{"Acc@1":"84.9","Acc@5":"96.7"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":61,"model":"ViViT-H/16x2 (JFT)","metrics":{"Acc@1":"84.9","Acc@5":"95.8"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15691","paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","code":"https://github.com/google-research/scenic","n_code_links":10,"syntology":{"n_ran":14,"n_unverified":7,"n_samples":21,"n_pointer_only_licence":1}},{"rank_in_archive_order":62,"model":"OMNIVORE (Swin-L)","metrics":{"Acc@1":"84.1","Acc@5":"96.1"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":63,"model":"OMNIVORE (Swin-B)","metrics":{"Acc@1":"84.0","Acc@5":"96.2"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":64,"model":"MAR (75% mask, ViT-L, 16x4)","metrics":{"Acc@1":"83.9","Acc@5":"96.0"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"ActionCLIP (CLIP-pretrained)","metrics":{"Acc@1":"83.8","Acc@5":"97.1"},"uses_additional_data":false,"paper_date":"2021-09-17","paper":"/paper/actionclip-a-new-paradigm-for-video-action","paper_url":"https://arxiv.org/abs/2109.08472v1","paper_title":"ActionCLIP: A New Paradigm for Video Action Recognition","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":66,"model":"OmniSource irCSN-152 (IG-Kinetics-65M pretrain)","metrics":{"Acc@1":"83.6"},"uses_additional_data":false,"paper_date":"2020-03-29","paper":"/paper/omni-sourced-webly-supervised-learning-for","paper_url":"https://arxiv.org/abs/2003.13042v2","paper_title":"Omni-sourced Webly-supervised Learning for Video Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":13,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":67,"model":"MVD (K400 pretrain, ViT-B, 16x224x224)","metrics":{"Acc@1":"83.4","Acc@5":"95.8"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":68,"model":"StructViT-B-4-1","metrics":{"Acc@1":"83.4"},"uses_additional_data":false,"paper_date":"2024-04-05","paper":"/paper/learning-correlation-structures-for-vision","paper_url":"https://arxiv.org/abs/2404.03924v1","paper_title":"Learning Correlation Structures for Vision Transformers","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":69,"model":"Swin-L (ImageNet-21k pretrain)","metrics":{"Acc@1":"83.1","Acc@5":"95.9"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":70,"model":"SIFA","metrics":{"Acc@1":"83.1"},"uses_additional_data":false,"paper_date":"2022-06-14","paper":"/paper/stand-alone-inter-frame-attention-in-video-1","paper_url":"https://arxiv.org/abs/2206.06931v1","paper_title":"Stand-Alone Inter-Frame Attention in Video Models","code":"https://github.com/fuchenustc/sifa","n_code_links":1,"syntology":null},{"rank_in_archive_order":71,"model":"UniFormer-B (ImageNet-1K)","metrics":{"Acc@1":"82.9","Acc@5":"94.5","FLOPs (G) x views":"259x4"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/uniformer-unified-transformer-for-efficient","paper_url":"https://openreview.net/forum?id=nBU_u6DLvoK","paper_title":"UniFormer: Unified Transformer for Efficient Spatial-Temporal Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":null},{"rank_in_archive_order":72,"model":"irCSN-152 (IG-Kinetics-65M pretrain)","metrics":{"Acc@1":"82.8"},"uses_additional_data":false,"paper_date":"2019-05-02","paper":"/paper/large-scale-weakly-supervised-pre-training","paper_url":"http://arxiv.org/abs/1905.00561v1","paper_title":"Large-scale weakly-supervised pre-training for video action recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":21,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":73,"model":"DirecFormer","metrics":{"Acc@1":"82.75","Acc@5":"94.86"},"uses_additional_data":false,"paper_date":"2022-03-19","paper":"/paper/direcformer-a-directed-attention-in","paper_url":"https://arxiv.org/abs/2203.10233v1","paper_title":"DirecFormer: A Directed Attention in Transformer Approach to Robust Action Recognition","code":"https://github.com/uark-cviu/direcformer","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":4,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":74,"model":"Swin-B (ImageNet-21k pretrain)","metrics":{"Acc@1":"82.7","Acc@5":"95.5"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"ir-CSN-152 (IG-65M pretraining)","metrics":{"Acc@1":"82.6"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"ip-CSN-152 (IG-65M pretraining)","metrics":{"Acc@1":"82.5","Acc@5":"95.3"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":77,"model":"TPS","metrics":{"Acc@1":"82.5"},"uses_additional_data":false,"paper_date":"2022-07-27","paper":"/paper/spatiotemporal-self-attention-modeling-with","paper_url":"https://arxiv.org/abs/2207.13259v1","paper_title":"Spatiotemporal Self-attention Modeling with Temporal Patch Shift for Action Recognition","code":"https://github.com/martinxm/tps","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"ILA (ViT-B/32)","metrics":{"Acc@1":"82.4","Acc@5":"95.8"},"uses_additional_data":false,"paper_date":"2023-04-20","paper":"/paper/implicit-temporal-modeling-with-learnable","paper_url":"https://arxiv.org/abs/2304.10465v2","paper_title":"Implicit Temporal Modeling with Learnable Alignment for Video Recognition","code":"https://github.com/francis-rings/ila","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":79,"model":"AMD(ViT-B/16)","metrics":{"Acc@1":"82.2","Acc@5":"95.3","FLOPs (G) x views":"180x15","Parameters (M)":"87"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":80,"model":"VATT-Large","metrics":{"Acc@1":"82.1","Acc@5":"95.5"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/vatt-transformers-for-multimodal-self","paper_url":"https://arxiv.org/abs/2104.11178v3","paper_title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","code":"https://github.com/google-research/google-research/tree/master/vatt","n_code_links":5,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":81,"model":"AdaMAE","metrics":{"Acc@1":"81.7","Acc@5":"95.2"},"uses_additional_data":false,"paper_date":"2022-11-16","paper":"/paper/adamae-adaptive-masking-for-efficient","paper_url":"https://arxiv.org/abs/2211.09120v1","paper_title":"AdaMAE: Adaptive Masking for Efficient Spatiotemporal Learning with Masked Autoencoders","code":"https://github.com/wgcban/adamae","n_code_links":2,"syntology":{"n_ran":9,"n_unverified":16,"n_samples":25,"n_pointer_only_licence":0}},{"rank_in_archive_order":82,"model":"VideoMAE (no extra data, ViT-B, 16x4)","metrics":{"Acc@1":"81.5","Acc@5":"95.1"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":83,"model":"MoViNet-A6","metrics":{"Acc@1":"81.5","FLOPs (G) x views":"386x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":84,"model":"MLP-3D","metrics":{"Acc@1":"81.4"},"uses_additional_data":false,"paper_date":"2022-06-13","paper":"/paper/mlp-3d-a-mlp-like-3d-architecture-with-1","paper_url":"https://arxiv.org/abs/2206.06292v1","paper_title":"MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":85,"model":"R[2+1]D-152 (IG-65M pretraining)","metrics":{"Acc@1":"81.3","Acc@5":"95.1"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"LGD-3D Two-stream (ResNet-101)","metrics":{"Acc@1":"81.2","Acc@5":"95.2"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":87,"model":"MViT-B, 64x3","metrics":{"Acc@1":"81.2","Acc@5":"95.1"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":88,"model":"Motionformer-HR","metrics":{"Acc@1":"81.1","Acc@5":"95.2"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/keeping-your-eye-on-the-ball-trajectory","paper_url":"https://arxiv.org/abs/2106.05392v2","paper_title":"Keeping Your Eye on the Ball: Trajectory Attention in Video Transformers","code":"https://github.com/facebookresearch/xformers","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":89,"model":"MVD (K400 pretrain, ViT-S, 16x224x224)","metrics":{"Acc@1":"81.0","Acc@5":"94.8"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":90,"model":"MAR (50% mask, ViT-B, 16x4)","metrics":{"Acc@1":"81.0","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":91,"model":"MoViNet-A5","metrics":{"Acc@1":"80.9","Acc@5":"94.9","FLOPs (G) x views":"281x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"MBT (AV)","metrics":{"Acc@1":"80.8","Acc@5":"94.6"},"uses_additional_data":false,"paper_date":"2021-06-30","paper":"/paper/attention-bottlenecks-for-multimodal-fusion","paper_url":"https://arxiv.org/abs/2107.00135v3","paper_title":"Attention Bottlenecks for Multimodal Fusion","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/mbt","n_code_links":1,"syntology":null},{"rank_in_archive_order":93,"model":"TimeSformer-L","metrics":{"Acc@1":"80.7","Acc@5":"94.7","FLOPs (G) x views":"7140x3","Parameters (M)":"121.4"},"uses_additional_data":false,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":94,"model":"Swin-B (ImageNet-1k pretrain)","metrics":{"Acc@1":"80.6","Acc@5":"94.6"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":95,"model":"Swin-S (ImageNet-1k pretrain)","metrics":{"Acc@1":"80.6","Acc@5":"94.5"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":96,"model":"En-VidTr-L","metrics":{"Acc@1":"80.5","Acc@5":"94.6"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":97,"model":"MoViNet-A4","metrics":{"Acc@1":"80.5","Acc@5":"94.5","FLOPs (G) x views":"105x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"OmniSource SlowOnly R101 8x8(ImageNet pretrain)","metrics":{"Acc@1":"80.5","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2020-03-29","paper":"/paper/omni-sourced-webly-supervised-learning-for","paper_url":"https://arxiv.org/abs/2003.13042v2","paper_title":"Omni-sourced Webly-supervised Learning for Video Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":13,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":99,"model":"STAM (64 Frames)","metrics":{"Acc@1":"80.5","FLOPs (G) x views":"1040x1"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/an-image-is-worth-16x16-words-what-is-a-video","paper_url":"https://arxiv.org/abs/2103.13915v2","paper_title":"An Image is Worth 16x16 Words, What is a Video Worth?","code":"https://github.com/Alibaba-MIIL/STAM","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":100,"model":"X3D-XXL","metrics":{"Acc@1":"80.4","Acc@5":"94.6"},"uses_additional_data":false,"paper_date":"2020-04-09","paper":"/paper/x3d-expanding-architectures-for-efficient","paper_url":"https://arxiv.org/abs/2004.04730v1","paper_title":"X3D: Expanding Architectures for Efficient Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":13,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"R3D-RS-200","metrics":{"Acc@1":"80.4","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2021-09-03","paper":"/paper/revisiting-3d-resnets-for-video-recognition","paper_url":"https://arxiv.org/abs/2109.01696v1","paper_title":"Revisiting 3D ResNets for Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":5,"syntology":null},{"rank_in_archive_order":102,"model":"OmniSource SlowOnly R101 8x8 (Scratch)","metrics":{"Acc@1":"80.4","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2020-03-29","paper":"/paper/omni-sourced-webly-supervised-learning-for","paper_url":"https://arxiv.org/abs/2003.13042v2","paper_title":"Omni-sourced Webly-supervised Learning for Video Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":13,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":103,"model":"MViT-B, 32x3","metrics":{"Acc@1":"80.2","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":104,"model":"AMD(ViT-S/16)","metrics":{"Acc@1":"80.1","Acc@5":"94.5","FLOPs (G) x views":"57X15","Parameters (M)":"22"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":105,"model":"SlowFast 16x8 (ResNet-101 + NL)","metrics":{"Acc@1":"79.8"},"uses_additional_data":true,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":106,"model":"CT-Net Ensemble","metrics":{"Acc@1":"79.8"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/ct-net-channel-tensorization-network-for-1","paper_url":"https://arxiv.org/abs/2106.01603v1","paper_title":"CT-Net: Channel Tensorization Network for Video Classification","code":"https://github.com/Andy1621/CT-Net","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":107,"model":"ViT-B-VTN+ ImageNet-21K (84.0 [10])","metrics":{"Acc@1":"79.8"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/video-transformer-network","paper_url":"https://arxiv.org/abs/2102.00719v3","paper_title":"Video Transformer Network","code":"https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md","n_code_links":1,"syntology":null},{"rank_in_archive_order":108,"model":"TimeSformer-HR","metrics":{"Acc@1":"79.7","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":109,"model":"En-VidTr-M","metrics":{"Acc@1":"79.7","Acc@5":"94.2"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":110,"model":"LGD-3D RGB (ResNet-101)","metrics":{"Acc@1":"79.4","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":111,"model":"TDN-ResNet101 (ensemble, ImageNet pretrained, RGB only)","metrics":{"Acc@1":"79.4","Acc@5":"94.4"},"uses_additional_data":false,"paper_date":"2020-12-18","paper":"/paper/tdn-temporal-difference-networks-for","paper_url":"https://arxiv.org/abs/2012.10071v2","paper_title":"TDN: Temporal Difference Networks for Efficient Action Recognition","code":"https://github.com/MCG-NJU/TDN","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":112,"model":"En-VidTr-S","metrics":{"Acc@1":"79.4","Acc@5":"94"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":113,"model":"MAR (75% mask, ViT-B, 16x4)","metrics":{"Acc@1":"79.4","Acc@5":"93.7"},"uses_additional_data":false,"paper_date":"2022-07-24","paper":"/paper/mar-masked-autoencoders-for-efficient-action","paper_url":"https://arxiv.org/abs/2207.11660v1","paper_title":"MAR: Masked Autoencoders for Efficient Action Recognition","code":"https://github.com/alibaba-mmai-research/masked-action-recognition","n_code_links":1,"syntology":null},{"rank_in_archive_order":114,"model":"STAM (16 Frames)","metrics":{"Acc@1":"79.3","FLOPs (G) x views":"270x1"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/an-image-is-worth-16x16-words-what-is-a-video","paper_url":"https://arxiv.org/abs/2103.13915v2","paper_title":"An Image is Worth 16x16 Words, What is a Video Worth?","code":"https://github.com/Alibaba-MIIL/STAM","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":115,"model":"ip-CSN-152 (Sports-1M pretraining)","metrics":{"Acc@1":"79.2","Acc@5":"93.8"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":116,"model":"CorrNet","metrics":{"Acc@1":"79.2"},"uses_additional_data":false,"paper_date":"2019-06-07","paper":"/paper/video-modeling-with-correlation-networks","paper_url":"https://arxiv.org/abs/1906.03349v2","paper_title":"Video Modeling with Correlation Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":117,"model":"OmniVL","metrics":{"Acc@1":"79.1","Acc@5":"94.5"},"uses_additional_data":false,"paper_date":"2022-09-15","paper":"/paper/omnivl-one-foundation-model-for-image","paper_url":"https://arxiv.org/abs/2209.07526v2","paper_title":"OmniVL:One Foundation Model for Image-Language and Video-Language Tasks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":118,"model":"X3D-XL","metrics":{"Acc@1":"79.1","Acc@5":"93.9"},"uses_additional_data":false,"paper_date":"2020-04-09","paper":"/paper/x3d-expanding-architectures-for-efficient","paper_url":"https://arxiv.org/abs/2004.04730v1","paper_title":"X3D: Expanding Architectures for Efficient Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":13,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":119,"model":"MVFNet-ResNet101 (ensemble, ImageNet pretrained, RGB only)","metrics":{"Acc@1":"79.1","Acc@5":"93.8"},"uses_additional_data":false,"paper_date":"2020-12-13","paper":"/paper/mvfnet-multi-view-fusion-network-for","paper_url":"https://arxiv.org/abs/2012.06977v2","paper_title":"MVFNet: Multi-View Fusion Network for Efficient Video Recognition","code":"https://github.com/whwu95/MVFNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":120,"model":"TAdaConvNeXt-T","metrics":{"Acc@1":"79.1","Acc@5":"93.7"},"uses_additional_data":false,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"SlowFast 16x8 (ResNet-101)","metrics":{"Acc@1":"78.9","Acc@5":"93.5"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":122,"model":"G-Blend (Sports-1M pretrain)","metrics":{"Acc@1":"78.9"},"uses_additional_data":false,"paper_date":"2019-05-29","paper":"/paper/what-makes-training-multi-modal-networks-hard","paper_url":"https://arxiv.org/abs/1905.12681v5","paper_title":"What Makes Training Multi-Modal Classification Networks Hard?","code":"https://github.com/facebookresearch/R2Plus1D","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":123,"model":"Swin-T (ImageNet-1k pretrain)","metrics":{"Acc@1":"78.8","Acc@5":"93.6"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/video-swin-transformer","paper_url":"https://arxiv.org/abs/2106.13230v1","paper_title":"Video Swin Transformer","code":"https://github.com/open-mmlab/mmaction2","n_code_links":15,"syntology":{"n_ran":7,"n_unverified":25,"n_samples":32,"n_pointer_only_licence":0}},{"rank_in_archive_order":124,"model":"GB + DF + LB (ResNet 152, ImageNet pretrained)","metrics":{"Acc@1":"78.8"},"uses_additional_data":false,"paper_date":"2019-08-20","paper":"/paper/190807625","paper_url":"https://arxiv.org/abs/1908.07625v1","paper_title":"Action recognition with spatial-temporal discriminative filter banks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":125,"model":"ViT-B-VTN (3 layers, ImageNet pretrain)","metrics":{"Acc@1":"78.6","Acc@5":"93.7"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/video-transformer-network","paper_url":"https://arxiv.org/abs/2102.00719v3","paper_title":"Video Transformer Network","code":"https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md","n_code_links":1,"syntology":null},{"rank_in_archive_order":126,"model":"MViT-B, 16x4","metrics":{"Acc@1":"78.4","Acc@5":"93.5"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":127,"model":"MoViNet-A3","metrics":{"Acc@1":"78.2","Acc@5":"93.8","FLOPs (G) x views":"56.9x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":128,"model":"TAda2D-En (ResNet-50, 8+16 frames)","metrics":{"Acc@1":"78.2","Acc@5":"93.5"},"uses_additional_data":false,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":129,"model":"SVT","metrics":{"Acc@1":"78.1"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/self-supervised-video-transformer","paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","code":"https://github.com/kahnchana/svt","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":130,"model":"TimeSformer","metrics":{"Acc@1":"78","Acc@5":"93.7"},"uses_additional_data":false,"paper_date":"2021-02-09","paper":"/paper/is-space-time-attention-all-you-need-for","paper_url":"https://arxiv.org/abs/2102.05095v4","paper_title":"Is Space-Time Attention All You Need for Video Understanding?","code":"https://github.com/open-mmlab/mmaction2","n_code_links":16,"syntology":{"n_ran":35,"n_unverified":8,"n_samples":43,"n_pointer_only_licence":14}},{"rank_in_archive_order":131,"model":"SlowFast 8x8 (ResNet-101)","metrics":{"Acc@1":"77.9","Acc@5":"93.2"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":132,"model":"RepFlow-50 ([2+1]D CNN, FcF, Non-local block)","metrics":{"Acc@1":"77.9"},"uses_additional_data":false,"paper_date":"2018-10-02","paper":"/paper/representation-flow-for-action-recognition","paper_url":"https://arxiv.org/abs/1810.01455v3","paper_title":"Representation Flow for Action Recognition","code":"https://github.com/piergiaj/representation-flow-cvpr19","n_code_links":5,"syntology":null},{"rank_in_archive_order":133,"model":"ip-CSN-152","metrics":{"Acc@1":"77.8","Acc@5":"92.8"},"uses_additional_data":false,"paper_date":"2019-04-04","paper":"/paper/video-classification-with-channel-separated","paper_url":"https://arxiv.org/abs/1904.02811v4","paper_title":"Video Classification with Channel-Separated Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":134,"model":"I3D + NL","metrics":{"Acc@1":"77.7","Acc@5":"93.3"},"uses_additional_data":false,"paper_date":"2017-11-21","paper":"/paper/non-local-neural-networks","paper_url":"http://arxiv.org/abs/1711.07971v3","paper_title":"Non-local Neural Networks","code":"https://github.com/facebookresearch/detectron","n_code_links":32,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":135,"model":"G-Blend","metrics":{"Acc@1":"77.7"},"uses_additional_data":false,"paper_date":"2019-05-29","paper":"/paper/what-makes-training-multi-modal-networks-hard","paper_url":"https://arxiv.org/abs/1905.12681v5","paper_title":"What Makes Training Multi-Modal Classification Networks Hard?","code":"https://github.com/facebookresearch/R2Plus1D","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"HATNet (32 frames)","metrics":{"Acc@1":"77.6"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/holistic-large-scale-video-understanding","paper_url":"https://arxiv.org/abs/1904.11451v3","paper_title":"Large Scale Holistic Video Understanding","code":"https://github.com/holistic-video-understanding/HVU-Dataset","n_code_links":1,"syntology":null},{"rank_in_archive_order":137,"model":"X3D-L","metrics":{"Acc@1":"77.5","Acc@5":"92.9"},"uses_additional_data":false,"paper_date":"2020-04-09","paper":"/paper/x3d-expanding-architectures-for-efficient","paper_url":"https://arxiv.org/abs/2004.04730v1","paper_title":"X3D: Expanding Architectures for Efficient Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":13,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":138,"model":"CoST ResNet-101  (ImageNet pretrain)","metrics":{"Acc@1":"77.5"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/collaborative-spatiotemporal-feature-learning","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Li_Collaborative_Spatiotemporal_Feature_Learning_for_Video_Action_Recognition_CVPR_2019_paper.html","paper_title":"Collaborative Spatiotemporal Feature Learning for Video Action Recognition","code":"https://github.com/hikvision-research/cost","n_code_links":1,"syntology":null},{"rank_in_archive_order":139,"model":"TAda2D (ResNet-50, 16 frames)","metrics":{"Acc@1":"77.4","Acc@5":"93.1"},"uses_additional_data":false,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":140,"model":"EvaNet","metrics":{"Acc@1":"77.4"},"uses_additional_data":false,"paper_date":"2018-11-26","paper":"/paper/evolving-space-time-neural-architectures-for","paper_url":"https://arxiv.org/abs/1811.10636v2","paper_title":"Evolving Space-Time Neural Architectures for Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":141,"model":"RNL+TSM Ensemble(ResNet50, 8 + 16 frames)","metrics":{"Acc@1":"77.4"},"uses_additional_data":false,"paper_date":"2020-07-17","paper":"/paper/region-based-non-local-operation-for-video","paper_url":"https://arxiv.org/abs/2007.09033v5","paper_title":"Region-based Non-local Operation for Video Classification","code":"https://github.com/guoxih/region-based-non-local-network","n_code_links":1,"syntology":null},{"rank_in_archive_order":142,"model":"VIMPAC","metrics":{"Acc@1":"77.4"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/vimpac-video-pre-training-via-masked-token","paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","code":"https://github.com/airsplay/vimpac","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":143,"model":"BQN (ResNet-50)","metrics":{"Acc@1":"77.3","Acc@5":"93.2"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/video-classification-with-finecoarse-networks","paper_url":"https://arxiv.org/abs/2103.15584v4","paper_title":"Busy-Quiet Video Disentangling for Video Classification","code":"https://github.com/guoxih/busy-quiet-net","n_code_links":2,"syntology":null},{"rank_in_archive_order":144,"model":"S3D-G (RGB+Flow, ImageNet pretrained)","metrics":{"Acc@1":"77.2","Acc@5":"93"},"uses_additional_data":false,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":145,"model":"SlowFast 8x8 (ResNet-50)","metrics":{"Acc@1":"77","Acc@5":"92.6"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":146,"model":"TAda2D (ResNet-50, 8 frames)","metrics":{"Acc@1":"76.7","Acc@5":"92.6"},"uses_additional_data":false,"paper_date":"2021-10-12","paper":"/paper/tada-temporally-adaptive-convolutions-for-1","paper_url":"https://arxiv.org/abs/2110.06178v4","paper_title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","code":"https://github.com/alibaba-mmai-research/TAdaConv","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":147,"model":"D3D+S3D-G (RGB + RGB)","metrics":{"Acc@1":"76.5"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":148,"model":"MSNet-R50 (16 frames, ImageNet pretrained)","metrics":{"Acc@1":"76.4"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/motionsqueeze-neural-motion-feature-learning","paper_url":"https://arxiv.org/abs/2007.09933v1","paper_title":"MotionSqueeze: Neural Motion Feature Learning for Video Understanding","code":"https://github.com/arunos728/MotionSqueeze","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":5,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":149,"model":"GloRe","metrics":{"Acc@1":"76.1"},"uses_additional_data":false,"paper_date":"2019-06-03","paper":"/paper/190600550","paper_url":"https://arxiv.org/abs/1906.00550v1","paper_title":"Global Textual Relation Embedding for Relational Understanding","code":"https://github.com/czyssrs/GloREPlus","n_code_links":1,"syntology":null},{"rank_in_archive_order":150,"model":"X3D-M","metrics":{"Acc@1":"76","Acc@5":"92.3"},"uses_additional_data":false,"paper_date":"2020-04-09","paper":"/paper/x3d-expanding-architectures-for-efficient","paper_url":"https://arxiv.org/abs/2004.04730v1","paper_title":"X3D: Expanding Architectures for Efficient Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":13,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":151,"model":"MViT-S","metrics":{"Acc@1":"76","Acc@5":"92.1"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":152,"model":"CMA iter1 (16 frames)","metrics":{"Acc@1":"75.98"},"uses_additional_data":false,"paper_date":"2019-08-01","paper":"/paper/two-stream-video-classification-with-cross","paper_url":"https://arxiv.org/abs/1908.00497v1","paper_title":"Two-Stream Video Classification with Cross-Modality Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":153,"model":"D3D (RGB)","metrics":{"Acc@1":"75.9"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":154,"model":"Oct-I3D + NL","metrics":{"Acc@1":"75.7"},"uses_additional_data":false,"paper_date":"2019-04-10","paper":"/paper/drop-an-octave-reducing-spatial-redundancy-in","paper_url":"https://arxiv.org/abs/1904.05049v3","paper_title":"Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution","code":"https://github.com/osmr/imgclsmob","n_code_links":28,"syntology":{"n_ran":14,"n_unverified":20,"n_samples":34,"n_pointer_only_licence":8}},{"rank_in_archive_order":155,"model":"SlowFast 4x16 (ResNet-50)","metrics":{"Acc@1":"75.6","Acc@5":"92.1"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":156,"model":"R[2+1]D-Flow (Sports-1M pretrain)","metrics":{"Acc@1":"75.4","Acc@5":"91.9"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":157,"model":"FASTER32","metrics":{"Acc@1":"75.1"},"uses_additional_data":false,"paper_date":"2019-06-10","paper":"/paper/faster-recurrent-networks-for-video","paper_url":"https://arxiv.org/abs/1906.04226v2","paper_title":"FASTER Recurrent Networks for Efficient Video Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":158,"model":"MoViNet-A2","metrics":{"Acc@1":"75.0","Acc@5":"92.3","FLOPs (G) x views":"10.3x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":159,"model":"MARS+RGB+Flow (64 frames)","metrics":{"Acc@1":"74.9"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":160,"model":"S3D-G (RGB, ImageNet pretrained)","metrics":{"Acc@1":"74.7","Acc@5":"93.4"},"uses_additional_data":false,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":161,"model":"TSM","metrics":{"Acc@1":"74.7"},"uses_additional_data":false,"paper_date":"2018-11-20","paper":"/paper/temporal-shift-module-for-efficient-video","paper_url":"https://arxiv.org/abs/1811.08383v3","paper_title":"TSM: Temporal Shift Module for Efficient Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":13,"syntology":{"n_ran":6,"n_unverified":10,"n_samples":16,"n_pointer_only_licence":4}},{"rank_in_archive_order":162,"model":"A2 Net","metrics":{"Acc@1":"74.6","Acc@5":"91.5"},"uses_additional_data":false,"paper_date":"2018-10-27","paper":"/paper/a2-nets-double-attention-networks","paper_url":"http://arxiv.org/abs/1810.11579v1","paper_title":"$A^2$-Nets: Double Attention Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":163,"model":"R[2+1]D-RGB (Sports-1M pretrain)","metrics":{"Acc@1":"74.3","Acc@5":"91.4"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":164,"model":"TSN","metrics":{"Acc@1":"73.9","Acc@5":"91.1"},"uses_additional_data":false,"paper_date":"2016-08-02","paper":"/paper/temporal-segment-networks-towards-good","paper_url":"http://arxiv.org/abs/1608.00859v1","paper_title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":22,"syntology":{"n_ran":2,"n_unverified":22,"n_samples":24,"n_pointer_only_licence":3}},{"rank_in_archive_order":165,"model":"R[2+1]D-Two-Stream","metrics":{"Acc@1":"73.9","Acc@5":"90.9"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":166,"model":"TSN","metrics":{"Acc@1":"73.9"},"uses_additional_data":false,"paper_date":"2017-08-16","paper":"/paper/convnet-architecture-search-for","paper_url":"http://arxiv.org/abs/1708.05038v1","paper_title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","code":"https://github.com/farazahmeds/Classification-of-brain-tumor-using-Spatiotemporal-models","n_code_links":1,"syntology":null},{"rank_in_archive_order":167,"model":"STM (ResNet-50)","metrics":{"Acc@1":"73.7"},"uses_additional_data":false,"paper_date":"2019-08-07","paper":"/paper/stm-spatiotemporal-and-motion-encoding-for","paper_url":"https://arxiv.org/abs/1908.02486v2","paper_title":"STM: SpatioTemporal and Motion Encoding for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":168,"model":"bLVNet Fan et al. (2019)","metrics":{"Acc@1":"73.5","Acc@5":"91.2"},"uses_additional_data":false,"paper_date":"2019-12-02","paper":"/paper/more-is-less-learning-efficient-video-1","paper_url":"https://arxiv.org/abs/1912.00869v1","paper_title":"More Is Less: Learning Efficient Video Representations by Big-Little Network and Depthwise Temporal Aggregation","code":"https://github.com/IBM/bLVNet-TAM","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":169,"model":"Co Slow_64","metrics":{"Acc@1":"73.05","FLOPs (G) x views":"6.90x1","Parameters (M)":"32.45"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":170,"model":"Inception-ResNet","metrics":{"Acc@1":"73.0","Acc@5":"90.9"},"uses_additional_data":false,"paper_date":"2017-08-12","paper":"/paper/revisiting-the-effectiveness-of-off-the-shelf","paper_url":"http://arxiv.org/abs/1708.03805v1","paper_title":"Revisiting the Effectiveness of Off-the-shelf Temporal Modeling Approaches for Large-scale Video Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":171,"model":"MFNet","metrics":{"Acc@1":"72.8","Acc@5":"90.4"},"uses_additional_data":false,"paper_date":"2018-07-30","paper":"/paper/multi-fiber-networks-for-video-recognition","paper_url":"http://arxiv.org/abs/1807.11195v3","paper_title":"Multi-Fiber Networks for Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":172,"model":"MoViNet-A1","metrics":{"Acc@1":"72.7","Acc@5":"91.2","FLOPs (G) x views":"6.0x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":173,"model":"ARTNet","metrics":{"Acc@1":"72.4","Acc@5":"90.4"},"uses_additional_data":false,"paper_date":"2017-11-24","paper":"/paper/appearance-and-relation-networks-for-video","paper_url":"http://arxiv.org/abs/1711.09125v2","paper_title":"Appearance-and-Relation Networks for Video Classification","code":"https://github.com/wanglimin/ARTNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":174,"model":"LGD-3D Flow (ResNet-101)","metrics":{"Acc@1":"72.3","Acc@5":"90.9"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":175,"model":"R[2+1]D","metrics":{"Acc@1":"72","Acc@5":"90"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":176,"model":"R[2+1]D-RGB","metrics":{"Acc@1":"72","Acc@5":"90"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":177,"model":"FASTER16 w/o sp","metrics":{"Acc@1":"71.7"},"uses_additional_data":false,"paper_date":"2019-06-10","paper":"/paper/faster-recurrent-networks-for-video","paper_url":"https://arxiv.org/abs/1906.04226v2","paper_title":"FASTER Recurrent Networks for Efficient Video Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":178,"model":"Co X3D-L_64","metrics":{"Acc@1":"71.61","FLOPs (G) x views":"1.25x1","Parameters (M)":"6.15"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":179,"model":"I3D","metrics":{"Acc@1":"71.1","Acc@5":"89.3"},"uses_additional_data":false,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":180,"model":"Co X3D-M_64","metrics":{"Acc@1":"71.03","FLOPs (G) x views":"0.33x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":181,"model":"X3D-L","metrics":{"Acc@1":"69.29","FLOPs (G) x views":"19.17x1","Parameters (M)":"6.15"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":182,"model":"MARS+RGB+Flow (16 frames)","metrics":{"Acc@1":"68.9"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":183,"model":"SlowFast-8×8-R50","metrics":{"Acc@1":"68.45","FLOPs (G) x views":"66.25x1","Parameters (M)":"66.25"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":184,"model":"S3D-G (Flow, ImageNet pretrained)","metrics":{"Acc@1":"68","Acc@5":"87.6"},"uses_additional_data":false,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":185,"model":"R[2+1]D-Flow","metrics":{"Acc@1":"67.5","Acc@5":"87.2"},"uses_additional_data":false,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":186,"model":"Slow-8x8-R50","metrics":{"Acc@1":"67.42","FLOPs (G) x views":"54.87x1","Parameters (M)":"32.45"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":187,"model":"Co X3D-S_64","metrics":{"Acc@1":"67.33","FLOPs (G) x views":"0.17x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":188,"model":"X3D-M","metrics":{"Acc@1":"67.24","FLOPs (G) x views":"4.97x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":189,"model":"SlowFast-4×16-R50","metrics":{"Acc@1":"67.06","FLOPs (G) x views":"36.46x1","Parameters (M)":"34.48"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":190,"model":"Co Slow_8","metrics":{"Acc@1":"65.90","FLOPs (G) x views":"6.90x1","Parameters (M)":"32.45"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":191,"model":"MoViNet-A0","metrics":{"Acc@1":"65.8","Acc@5":"87.4","FLOPs (G) x views":"2.7x1"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":192,"model":"X3D-S","metrics":{"Acc@1":"64.71","FLOPs (G) x views":"2.06x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":193,"model":"I3D-R50","metrics":{"Acc@1":"63.98","FLOPs (G) x views":"28.61x1","Parameters (M)":"28.04"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":194,"model":"Co X3D-L_16","metrics":{"Acc@1":"63.03","FLOPs (G) x views":"1.25x1","Parameters (M)":"6.15"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":195,"model":"Co X3D-M_16","metrics":{"Acc@1":"62.80","FLOPs (G) x views":"0.33x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":196,"model":"Co X3D-S_13","metrics":{"Acc@1":"60.18","FLOPs (G) x views":"0.17x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":197,"model":"Co I3D_8","metrics":{"Acc@1":"59.58","FLOPs (G) x views":"5.68x1","Parameters (M)":"28.04"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":198,"model":"R(2+1)D-18_16","metrics":{"Acc@1":"59.52","FLOPs (G) x views":"40.71x1","Parameters (M)":"31.51"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":199,"model":"X3D-XS","metrics":{"Acc@1":"59.37","FLOPs (G) x views":"0.64x1","Parameters (M)":"3.79"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":200,"model":"Co I3D_64","metrics":{"Acc@1":"56.86","FLOPs (G) x views":"5.68x1","Parameters (M)":"28.04"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":201,"model":"R(2+1)D-18_8","metrics":{"Acc@1":"53.52","FLOPs (G) x views":"20.35x1","Parameters (M)":"31.51"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":202,"model":"RCU_8","metrics":{"Acc@1":"53.40","FLOPs (G) x views":"4.71x1","Parameters (M)":"12.80"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":203,"model":"ViViT-L/16x2 320","metrics":{"Acc@5":"94.7"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15691","paper_url":"https://arxiv.org/abs/2103.15691v2","paper_title":"ViViT: A Video Vision Transformer","code":"https://github.com/google-research/scenic","n_code_links":10,"syntology":{"n_ran":14,"n_unverified":7,"n_samples":21,"n_pointer_only_licence":1}},{"rank_in_archive_order":204,"model":"ViT-B-VTN+ ImageNet-21K (84.0 [10])","metrics":{"Acc@5":"94.2"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/video-transformer-network","paper_url":"https://arxiv.org/abs/2102.00719v3","paper_title":"Video Transformer Network","code":"https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md","n_code_links":1,"syntology":null},{"rank_in_archive_order":205,"model":"SlowFast 16x8 (ResNet-101 + NL)","metrics":{"Acc@5":"93.9"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":206,"model":"ViT-B-VTN (1 layer, ImageNet pretrain)","metrics":{"Acc@5":"93.4"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/video-transformer-network","paper_url":"https://arxiv.org/abs/2102.00719v3","paper_title":"Video Transformer Network","code":"https://github.com/bomri/SlowFast/blob/master/projects/vtn/README.md","n_code_links":1,"syntology":null},{"rank_in_archive_order":207,"model":"MViT-B (train from scratch)","metrics":{"FLOPs (G) x views":"225x5"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,795 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6795,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2785},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":109,"rows_with_any_sample_ran":90,"distinct_papers_with_graph_line":54,"distinct_papers_with_any_sample_ran":46,"samples_over_distinct_papers":{"n_ran":256,"n_unverified":358,"n_samples":614,"n_pointer_only_licence":116,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":545,"n_unverified":782,"n_samples":1327,"n_pointer_only_licence":237,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}