{"url":"/sota/action-recognition-in-videos-on-ucf101","task":{"name":"Action Recognition","url":"/task/action-recognition-in-videos","note":null},"dataset":{"name":"UCF101","url":"/dataset/ucf101"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":"**Action Recognition** is a computer vision task that involves recognizing human actions in videos or images. The goal is to classify and categorize the actions being performed in the video or image into a predefined set of action classes.\r\n\r\nIn the video domain, it is an open question whether training an action classification network on a sufficiently large dataset, will give a similar boost in performance when applied to a different temporal task or dataset. The challenges of building video datasets has meant that most popular benchmarks for action recognition are small, having on the order of 10k videos. \r\n\r\nPlease note some benchmarks may be located in the [Action Classification](https://paperswithcode.com/task/action-classification) or [Video Classification](https://paperswithcode.com/task/video-classification) tasks, e.g. Kinetics-400.","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["3-fold Accuracy","Accuracy","Accuracy 20%Test"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"3-fold Accuracy":"higher","Accuracy":"higher","Accuracy 20%Test":"higher"}},"counts":{"rows":91,"rows_with_code":58,"rows_with_paper_page":90,"rows_dated":90,"rows_using_additional_data":31},"rows":[{"rank_in_archive_order":1,"model":"FTP-UniFormerV2-L/14","metrics":{"3-fold Accuracy":"99.7"},"uses_additional_data":false,"paper_date":"2024-03-24","paper":"/paper/enhancing-video-transformers-for-action","paper_url":"https://arxiv.org/abs/2403.16128v1","paper_title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":2,"model":"VideoMAE V2-g","metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"OmniVec","metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true,"paper_date":"2023-11-07","paper":"/paper/omnivec-learning-robust-representations-with","paper_url":"https://arxiv.org/abs/2311.05709v1","paper_title":"OmniVec: Learning robust representations with cross modal sharing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"OmniVec2","metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true,"paper_date":"2024-01-01","paper":"/paper/omnivec2-a-novel-transformer-based-network","paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"BIKE","metrics":{"3-fold Accuracy":"98.8"},"uses_additional_data":true,"paper_date":"2022-12-31","paper":"/paper/bidirectional-cross-modal-knowledge","paper_url":"https://arxiv.org/abs/2301.00182v2","paper_title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":6,"model":"SMART","metrics":{"3-fold Accuracy":"98.64"},"uses_additional_data":false,"paper_date":"2020-12-19","paper":"/paper/smart-frame-selection-for-action-recognition","paper_url":"https://arxiv.org/abs/2012.10671v1","paper_title":"SMART Frame Selection for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":7,"model":"OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)","metrics":{"3-fold Accuracy":"98.6"},"uses_additional_data":true,"paper_date":"2020-03-29","paper":"/paper/omni-sourced-webly-supervised-learning-for","paper_url":"https://arxiv.org/abs/2003.13042v2","paper_title":"Omni-sourced Webly-supervised Learning for Video Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"PERF-Net (multi-distilled S3D)","metrics":{"3-fold Accuracy":"98.6"},"uses_additional_data":false,"paper_date":"2020-09-28","paper":"/paper/perf-net-pose-empowered-rgb-flow-net","paper_url":"https://arxiv.org/abs/2009.13087v2","paper_title":"PERF-Net: Pose Empowered RGB-Flow Net","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"ZeroI2V ViT-L/14","metrics":{"3-fold Accuracy":"98.6"},"uses_additional_data":true,"paper_date":"2023-10-02","paper":"/paper/zeroi2v-zero-cost-adaptation-of-pre-trained","paper_url":"https://arxiv.org/abs/2310.01324v2","paper_title":"ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video","code":"https://github.com/mcg-nju/zeroi2v","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"LGD-3D Two-stream","metrics":{"3-fold Accuracy":"98.2"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":11,"model":"Text4Vis","metrics":{"3-fold Accuracy":"98.2"},"uses_additional_data":false,"paper_date":"2022-07-04","paper":"/paper/transferring-textual-knowledge-for-visual","paper_url":"https://arxiv.org/abs/2207.01297v4","paper_title":"Revisiting Classifier: Transferring Vision-Language Models for Video Recognition","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":12,"model":"Two-Stream I3D (Imagenet+Kinetics pre-training)","metrics":{"3-fold Accuracy":"98.0"},"uses_additional_data":false,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":13,"model":"MARS+RGB+Flow (64 frames, Kinetics pretrained)","metrics":{"3-fold Accuracy":"97.8"},"uses_additional_data":true,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":14,"model":"HATNet (32 frames)","metrics":{"3-fold Accuracy":"97.8"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/holistic-large-scale-video-understanding","paper_url":"https://arxiv.org/abs/1904.11451v3","paper_title":"Large Scale Holistic Video Understanding","code":"https://github.com/holistic-video-understanding/HVU-Dataset","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"Two-Stream I3D (Kinetics pre-training)","metrics":{"3-fold Accuracy":"97.8"},"uses_additional_data":false,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":16,"model":"BubbleNET","metrics":{"3-fold Accuracy":"97.62"},"uses_additional_data":true,"paper_date":"2020-10-30","paper":"/paper/bubblenet-a-disperse-recurrent-structure-to","paper_url":"https://ieeexplore.ieee.org/document/9190769","paper_title":"Bubblenet: A Disperse Recurrent Structure To Recognize Activities","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":17,"model":"D3D + D3D","metrics":{"3-fold Accuracy":"97.6"},"uses_additional_data":false,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"BQN","metrics":{"3-fold Accuracy":"97.6"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/video-classification-with-finecoarse-networks","paper_url":"https://arxiv.org/abs/2103.15584v4","paper_title":"Busy-Quiet Video Disentangling for Video Classification","code":"https://github.com/guoxih/busy-quiet-net","n_code_links":2,"syntology":null},{"rank_in_archive_order":19,"model":"CCS + TSN (ImageNet+Kinetics pretrained)","metrics":{"3-fold Accuracy":"97.4"},"uses_additional_data":true,"paper_date":"2019-08-27","paper":"/paper/cooperative-cross-stream-network-for","paper_url":"https://arxiv.org/abs/1908.10136v1","paper_title":"Cooperative Cross-Stream Network for Discriminative Action Representation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"R[2+1]D-TwoStream (Kinetics pretrained)","metrics":{"3-fold Accuracy":"97.3"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":21,"model":"Multi-stream I3D","metrics":{"3-fold Accuracy":"97.2"},"uses_additional_data":false,"paper_date":"2019-03-20","paper":"/paper/contextual-action-cues-from-camera-sensor-for","paper_url":"https://doi.org/10.3390/s19061382","paper_title":"Contextual Action Cues from Camera Sensor for Multi-Stream Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":22,"model":"CA2ST(B/16)","metrics":{"3-fold Accuracy":"97.2"},"uses_additional_data":false,"paper_date":"2025-03-30","paper":"/paper/ca-2st-cross-attention-in-audio-space-and","paper_url":"https://arxiv.org/abs/2503.23447v1","paper_title":"CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"Hidden Two-Stream","metrics":{"3-fold Accuracy":"97.1"},"uses_additional_data":false,"paper_date":"2017-04-02","paper":"/paper/hidden-two-stream-convolutional-networks-for","paper_url":"http://arxiv.org/abs/1704.00389v4","paper_title":"Hidden Two-Stream Convolutional Networks for Action Recognition","code":"https://github.com/bryanyzhu/two-stream-pytorch","n_code_links":3,"syntology":null},{"rank_in_archive_order":24,"model":"D3D (Kinetics-600 pretraining)","metrics":{"3-fold Accuracy":"97.1"},"uses_additional_data":true,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"AMD(ViT-B/16)","metrics":{"3-fold Accuracy":"97.1"},"uses_additional_data":true,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":26,"model":"D3D (Kinetics-400 pretraining)","metrics":{"3-fold Accuracy":"97"},"uses_additional_data":true,"paper_date":"2018-12-19","paper":"/paper/d3d-distilled-3d-networks-for-video-action","paper_url":"http://arxiv.org/abs/1812.08249v2","paper_title":"D3D: Distilled 3D Networks for Video Action Recognition","code":"https://github.com/princeton-vl/d3dhelper","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"LGD-3D RGB","metrics":{"3-fold Accuracy":"97"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":28,"model":"STAM-32 (ImageNet/Kinetics pretraining)","metrics":{"3-fold Accuracy":"97"},"uses_additional_data":true,"paper_date":"2021-03-25","paper":"/paper/an-image-is-worth-16x16-words-what-is-a-video","paper_url":"https://arxiv.org/abs/2103.13915v2","paper_title":"An Image is Worth 16x16 Words, What is a Video Worth?","code":"https://github.com/Alibaba-MIIL/STAM","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"FASTER32","metrics":{"3-fold Accuracy":"96.9"},"uses_additional_data":false,"paper_date":"2019-06-10","paper":"/paper/faster-recurrent-networks-for-video","paper_url":"https://arxiv.org/abs/1906.04226v2","paper_title":"FASTER Recurrent Networks for Efficient Video Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"R[2+1]D-RGB (Kinetics pretrained)","metrics":{"3-fold Accuracy":"96.8"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":31,"model":"S3D-G (ImageNet, Kinetics-400 pretrained)","metrics":{"3-fold Accuracy":"96.8"},"uses_additional_data":true,"paper_date":"2017-12-13","paper":"/paper/rethinking-spatiotemporal-feature-learning","paper_url":"http://arxiv.org/abs/1712.04851v2","paper_title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","code":"https://github.com/kylemin/S3D","n_code_links":2,"syntology":null},{"rank_in_archive_order":32,"model":"LGD-3D Flow","metrics":{"3-fold Accuracy":"96.8"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/learning-spatio-temporal-representation-with-3","paper_url":"https://arxiv.org/abs/1906.05571v1","paper_title":"Learning Spatio-Temporal Representation with Local and Global Diffusion","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"Flow-I3D (Imagenet+Kinetics pre-training)","metrics":{"3-fold Accuracy":"96.7"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":34,"model":"VidTr-L","metrics":{"3-fold Accuracy":"96.7"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":35,"model":"CMA iter1-S","metrics":{"3-fold Accuracy":"96.5"},"uses_additional_data":false,"paper_date":"2019-08-01","paper":"/paper/two-stream-video-classification-with-cross","paper_url":"https://arxiv.org/abs/1908.00497v1","paper_title":"Two-Stream Video Classification with Cross-Modality Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"Flow-I3D (Kinetics pre-training)","metrics":{"3-fold Accuracy":"96.5"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":37,"model":"I3D RGB + DMC-Net (I3D)","metrics":{"3-fold Accuracy":"96.5"},"uses_additional_data":false,"paper_date":"2019-01-11","paper":"/paper/dmc-net-generating-discriminative-motion-cues","paper_url":"https://arxiv.org/abs/1901.03460v3","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":38,"model":"A2-Net (ResNet-50)","metrics":{"3-fold Accuracy":"96.4"},"uses_additional_data":false,"paper_date":"2018-10-27","paper":"/paper/a2-nets-double-attention-networks","paper_url":"http://arxiv.org/abs/1810.11579v1","paper_title":"$A^2$-Nets: Double Attention Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":39,"model":"MF-Net, RGB only (ImageNet+Kinetics pretrained)","metrics":{"3-fold Accuracy":"96.0"},"uses_additional_data":true,"paper_date":"2018-07-30","paper":"/paper/multi-fiber-networks-for-video-recognition","paper_url":"http://arxiv.org/abs/1807.11195v3","paper_title":"Multi-Fiber Networks for Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"Optical Flow Guided Feature","metrics":{"3-fold Accuracy":"96"},"uses_additional_data":false,"paper_date":"2017-11-29","paper":"/paper/optical-flow-guided-feature-a-fast-and-robust","paper_url":"http://arxiv.org/abs/1711.11152v2","paper_title":"Optical Flow Guided Feature: A Fast and Robust Motion Representation for Video Action Recognition","code":"https://github.com/kevin-ssy/Optical-Flow-Guided-Feature","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"MARS+RGB+Flow (16 frames)","metrics":{"3-fold Accuracy":"95.8"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/mars-motion-augmented-rgb-stream-for-action","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Crasto_MARS_Motion-Augmented_RGB_Stream_for_Action_Recognition_CVPR_2019_paper.html","paper_title":"MARS: Motion-Augmented RGB Stream for Action Recognition","code":"https://github.com/craston/MARS","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"Prob-Distill","metrics":{"3-fold Accuracy":"95.7"},"uses_additional_data":false,"paper_date":"2019-04-05","paper":"/paper/paying-more-attention-to-motion-attention","paper_url":"https://arxiv.org/abs/1904.03249v2","paper_title":"Attention Distillation for Learning Video Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"RGB-I3D (Imagenet+Kinetics pre-training)","metrics":{"3-fold Accuracy":"95.6"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":44,"model":"R[2+1]D-Flow (Kinetics pretrained)","metrics":{"3-fold Accuracy":"95.5"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":45,"model":"TVNet+IDT","metrics":{"3-fold Accuracy":"95.4"},"uses_additional_data":false,"paper_date":"2018-04-02","paper":"/paper/end-to-end-learning-of-motion-representation","paper_url":"http://arxiv.org/abs/1804.00413v1","paper_title":"End-to-End Learning of Motion Representation for Video Understanding","code":"https://github.com/LijieFan/tvnet","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":46,"model":"TesNet (ImageNet pretrained)","metrics":{"3-fold Accuracy":"95.2"},"uses_additional_data":true,"paper_date":"2020-02-11","paper":"/paper/learning-spatio-temporal-representations-with","paper_url":"https://arxiv.org/abs/2002.04685v2","paper_title":"Learning spatio-temporal representations with temporal squeeze pooling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":47,"model":"I3D-LSTM","metrics":{"3-fold Accuracy":"95.1"},"uses_additional_data":false,"paper_date":"2019-08-09","paper":"/paper/i3d-lstm-a-new-model-for-human-action","paper_url":"https://doi.org/10.1088/1757-899X/569/3/032035","paper_title":"I3D-LSTM: A New Model for Human Action Recognition","code":"https://github.com/Mind23-2/MindCode-101/tree/main/I3D","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"RGB-I3D (Kinetics pre-training)","metrics":{"3-fold Accuracy":"95.1"},"uses_additional_data":true,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":49,"model":"R[2+1]D-TwoStream (Sports-1M pretrained)","metrics":{"3-fold Accuracy":"95"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":50,"model":"X3D MobileNet-V3 LGD-GC","metrics":{"3-fold Accuracy":"94.85"},"uses_additional_data":true,"paper_date":"2021-08-30","paper":"/paper/ligar-lightweight-general-purpose-action","paper_url":"https://arxiv.org/abs/2108.13153v1","paper_title":"LIGAR: Lightweight General-purpose Action Recognition","code":"https://github.com/openvinotoolkit/training_extensions","n_code_links":1,"syntology":null},{"rank_in_archive_order":51,"model":"ST-ResNet + IDT","metrics":{"3-fold Accuracy":"94.6"},"uses_additional_data":false,"paper_date":"2016-11-07","paper":"/paper/spatiotemporal-residual-networks-for-video","paper_url":"http://arxiv.org/abs/1611.02155v1","paper_title":"Spatiotemporal Residual Networks for Video Action Recognition","code":"https://github.com/feichtenhofer/st-resnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":52,"model":"ResNeXt-101 (64f)","metrics":{"3-fold Accuracy":"94.5"},"uses_additional_data":false,"paper_date":"2017-11-27","paper":"/paper/can-spatiotemporal-3d-cnns-retrace-the","paper_url":"http://arxiv.org/abs/1711.09577v2","paper_title":"Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet?","code":"https://github.com/kenshohara/3D-ResNets-PyTorch","n_code_links":26,"syntology":{"n_ran":7,"n_unverified":1,"n_samples":8,"n_pointer_only_licence":3}},{"rank_in_archive_order":53,"model":"R-STAN-101","metrics":{"3-fold Accuracy":"94.5"},"uses_additional_data":false,"paper_date":"2019-06-19","paper":"/paper/r-stan-residual-spatial-temporal-attention","paper_url":"https://doi.org/10.1109/ACCESS.2019.2923651","paper_title":"R-STAN: Residual Spatial-Temporal Attention Network for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":54,"model":"TSN+TSM","metrics":{"3-fold Accuracy":"94.3"},"uses_additional_data":false,"paper_date":"2018-09-11","paper":"/paper/temporal-spatial-mapping-for-action","paper_url":"http://arxiv.org/abs/1809.03669v1","paper_title":"Temporal-Spatial Mapping for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":55,"model":"ARTNet w/ TSN","metrics":{"3-fold Accuracy":"94.3"},"uses_additional_data":false,"paper_date":"2017-11-24","paper":"/paper/appearance-and-relation-networks-for-video","paper_url":"http://arxiv.org/abs/1711.09125v2","paper_title":"Appearance-and-Relation Networks for Video Classification","code":"https://github.com/wanglimin/ARTNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"Temporal Segment Networks","metrics":{"3-fold Accuracy":"94.2"},"uses_additional_data":false,"paper_date":"2016-08-02","paper":"/paper/temporal-segment-networks-towards-good","paper_url":"http://arxiv.org/abs/1608.00859v1","paper_title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","code":"https://github.com/open-mmlab/mmaction2","n_code_links":22,"syntology":{"n_ran":2,"n_unverified":22,"n_samples":24,"n_pointer_only_licence":3}},{"rank_in_archive_order":57,"model":"TS-LSTM","metrics":{"3-fold Accuracy":"94.1"},"uses_additional_data":false,"paper_date":"2017-03-30","paper":"/paper/ts-lstm-and-temporal-inception-exploiting","paper_url":"http://arxiv.org/abs/1703.10667v1","paper_title":"TS-LSTM and Temporal-Inception: Exploiting Spatiotemporal Dynamics for Activity Recognition","code":"https://github.com/jeffreyhuang1/two-stream-action-recognition","n_code_links":4,"syntology":null},{"rank_in_archive_order":58,"model":"SVT","metrics":{"3-fold Accuracy":"93.7"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/self-supervised-video-transformer","paper_url":"https://arxiv.org/abs/2112.01514v2","paper_title":"Self-supervised Video Transformer","code":"https://github.com/kahnchana/svt","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":59,"model":"R[2+1]D-RGB (Sports-1M pretrained)","metrics":{"3-fold Accuracy":"93.6"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":60,"model":"Two-stream I3D","metrics":{"3-fold Accuracy":"93.4"},"uses_additional_data":false,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":61,"model":"R[2+1]D-Flow (Sports-1M pretrained)","metrics":{"3-fold Accuracy":"93.3"},"uses_additional_data":true,"paper_date":"2017-11-30","paper":"/paper/a-closer-look-at-spatiotemporal-convolutions","paper_url":"http://arxiv.org/abs/1711.11248v3","paper_title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","code":"https://github.com/microsoft/computervision-recipes","n_code_links":24,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":62,"model":"VIMPAC","metrics":{"3-fold Accuracy":"92.7"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/vimpac-video-pre-training-via-masked-token","paper_url":"https://arxiv.org/abs/2106.11250v1","paper_title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","code":"https://github.com/airsplay/vimpac","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":63,"model":"S:VGG-16, T:VGG-16 (ImageNet pretrain)","metrics":{"3-fold Accuracy":"92.5"},"uses_additional_data":true,"paper_date":"2016-04-22","paper":"/paper/convolutional-two-stream-network-fusion-for","paper_url":"http://arxiv.org/abs/1604.06573v2","paper_title":"Convolutional Two-Stream Network Fusion for Video Action Recognition","code":"https://github.com/feichtenhofer/twostreamfusion","n_code_links":2,"syntology":null},{"rank_in_archive_order":64,"model":"DMC-Net (I3D)","metrics":{"3-fold Accuracy":"92.3"},"uses_additional_data":false,"paper_date":"2019-01-11","paper":"/paper/dmc-net-generating-discriminative-motion-cues","paper_url":"https://arxiv.org/abs/1901.03460v3","paper_title":"DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":65,"model":"two-in-one two stream","metrics":{"3-fold Accuracy":"92"},"uses_additional_data":false,"paper_date":"2019-04-01","paper":"/paper/dance-with-flow-two-in-one-stream-action","paper_url":"https://arxiv.org/abs/1904.00696v3","paper_title":"Dance with Flow: Two-in-One Stream Action Detection","code":"https://github.com/jiaozizhao/Two-in-One-ActionDetection","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"LTC","metrics":{"3-fold Accuracy":"91.7"},"uses_additional_data":false,"paper_date":"2016-04-15","paper":"/paper/long-term-temporal-convolutions-for-action","paper_url":"http://arxiv.org/abs/1604.04494v2","paper_title":"Long-term Temporal Convolutions for Action Recognition","code":"https://github.com/gulvarol/ltc","n_code_links":1,"syntology":null},{"rank_in_archive_order":67,"model":"R-STAN-50","metrics":{"3-fold Accuracy":"91.5"},"uses_additional_data":false,"paper_date":"2019-06-19","paper":"/paper/r-stan-residual-spatial-temporal-attention","paper_url":"https://doi.org/10.1109/ACCESS.2019.2923651","paper_title":"R-STAN: Residual Spatial-Temporal Attention Network for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":68,"model":"TDD + IDT","metrics":{"3-fold Accuracy":"91.5"},"uses_additional_data":false,"paper_date":"2015-05-19","paper":"/paper/action-recognition-with-trajectory-pooled","paper_url":"http://arxiv.org/abs/1505.04868v1","paper_title":"Action Recognition with Trajectory-Pooled Deep-Convolutional Descriptors","code":"https://github.com/damien911224/theWorldInSafety","n_code_links":1,"syntology":null},{"rank_in_archive_order":69,"model":"Very deep two-stream ConvNet","metrics":{"3-fold Accuracy":"91.4"},"uses_additional_data":false,"paper_date":"2015-07-08","paper":"/paper/towards-good-practices-for-very-deep-two","paper_url":"http://arxiv.org/abs/1507.02159v1","paper_title":"Towards Good Practices for Very Deep Two-Stream ConvNets","code":"https://github.com/bryanyzhu/two-stream-pytorch","n_code_links":5,"syntology":null},{"rank_in_archive_order":70,"model":"3D ResNeXt-101 + Confidence Distillation","metrics":{"3-fold Accuracy":"91.2"},"uses_additional_data":false,"paper_date":"2021-09-05","paper":"/paper/efficient-action-recognition-using-confidence","paper_url":"https://arxiv.org/abs/2109.02137v2","paper_title":"Efficient Action Recognition Using Confidence Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":71,"model":"MR Two-Sream R-CNN","metrics":{"3-fold Accuracy":"91.1"},"uses_additional_data":false,"paper_date":"2016-09-17","paper":"/paper/multi-region-two-stream-r-cnn-for-action","paper_url":"https://doi.org/10.1007/978-3-319-46493-0_45","paper_title":"Multi-region two-stream R-CNN for action detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":72,"model":"Dynamic Image Networks + IDT","metrics":{"3-fold Accuracy":"89.1"},"uses_additional_data":false,"paper_date":"2016-06-01","paper":"/paper/dynamic-image-networks-for-action-recognition","paper_url":"http://openaccess.thecvf.com/content_cvpr_2016/html/Bilen_Dynamic_Image_Networks_CVPR_2016_paper.html","paper_title":"Dynamic Image Networks for Action Recognition","code":"https://github.com/hbilen/dynamic-image-nets","n_code_links":1,"syntology":null},{"rank_in_archive_order":73,"model":"Two-stream+LSTM","metrics":{"3-fold Accuracy":"88.6"},"uses_additional_data":false,"paper_date":"2015-03-31","paper":"/paper/beyond-short-snippets-deep-networks-for-video","paper_url":"http://arxiv.org/abs/1503.08909v2","paper_title":"Beyond Short Snippets: Deep Networks for Video Classification","code":"https://github.com/shobrook/sequitur","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":74,"model":"P3D (ImageNet + Sports1M)","metrics":{"3-fold Accuracy":"88.6"},"uses_additional_data":true,"paper_date":"2017-11-28","paper":"/paper/learning-spatio-temporal-representation-with","paper_url":"http://arxiv.org/abs/1711.10305v1","paper_title":"Learning Spatio-Temporal Representation with Pseudo-3D Residual Networks","code":"https://github.com/qijiezhao/pseudo-3d-pytorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":75,"model":"Two-Stream (ImageNet pretrained)","metrics":{"3-fold Accuracy":"88.0"},"uses_additional_data":true,"paper_date":"2014-06-09","paper":"/paper/two-stream-convolutional-networks-for-action","paper_url":"http://arxiv.org/abs/1406.2199v2","paper_title":"Two-Stream Convolutional Networks for Action Recognition in Videos","code":"https://github.com/feichtenhofer/twostreamfusion","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":2}},{"rank_in_archive_order":76,"model":"MV-CNN","metrics":{"3-fold Accuracy":"86.4"},"uses_additional_data":false,"paper_date":"2016-04-26","paper":"/paper/real-time-action-recognition-with-enhanced","paper_url":"http://arxiv.org/abs/1604.07669v1","paper_title":"Real-time Action Recognition with Enhanced Motion Vector CNNs","code":"https://github.com/yjxiong/caffe","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"Dynamics 2 for DenseNet-201 Transformer","metrics":{"3-fold Accuracy":"86.1"},"uses_additional_data":false,"paper_date":"2023-02-17","paper":"/paper/video-action-recognition-collaborative","paper_url":"https://arxiv.org/abs/2302.09187v3","paper_title":"Video Action Recognition Collaborative Learning with Dynamics via PSO-ConvNet Transformer","code":"https://github.com/leonlha/video-action-recognition-collaborative-learning-with-dynamics-via-pso-convnet-transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":78,"model":"R(2+1)D-18 (DistInit pretraining)","metrics":{"3-fold Accuracy":"85.8"},"uses_additional_data":false,"paper_date":"2019-01-26","paper":"/paper/distinit-learning-video-representations","paper_url":"https://arxiv.org/abs/1901.09244v2","paper_title":"DistInit: Learning Video Representations Without a Single Labeled Video","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":79,"model":"Res3D","metrics":{"3-fold Accuracy":"85.8"},"uses_additional_data":false,"paper_date":"2017-08-16","paper":"/paper/convnet-architecture-search-for","paper_url":"http://arxiv.org/abs/1708.05038v1","paper_title":"ConvNet Architecture Search for Spatiotemporal Feature Learning","code":"https://github.com/farazahmeds/Classification-of-brain-tumor-using-Spatiotemporal-models","n_code_links":1,"syntology":null},{"rank_in_archive_order":80,"model":"ActionFlowNet","metrics":{"3-fold Accuracy":"83.9"},"uses_additional_data":false,"paper_date":"2016-12-09","paper":"/paper/actionflownet-learning-motion-representation","paper_url":"http://arxiv.org/abs/1612.03052v3","paper_title":"ActionFlowNet: Learning Motion Representation for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":81,"model":"C3D","metrics":{"3-fold Accuracy":"82.3"},"uses_additional_data":false,"paper_date":"2014-12-02","paper":"/paper/learning-spatiotemporal-features-with-3d","paper_url":"http://arxiv.org/abs/1412.0767v4","paper_title":"Learning Spatiotemporal Features with 3D Convolutional Networks","code":"https://github.com/open-mmlab/mmaction2","n_code_links":29,"syntology":null},{"rank_in_archive_order":82,"model":"HalluciNet (ResNet-50)","metrics":{"3-fold Accuracy":"79.83"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/hallucinet-ing-spatiotemporal-representations","paper_url":"https://arxiv.org/abs/1912.04430v3","paper_title":"HalluciNet-ing Spatiotemporal Representations Using a 2D-CNN","code":"https://github.com/ParitoshParmar/HalluciNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":83,"model":"R[2+1]D (VideoMoCo)","metrics":{"3-fold Accuracy":"78.7"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/videomoco-contrastive-video-representation","paper_url":"https://arxiv.org/abs/2103.05905v2","paper_title":"VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples","code":"https://github.com/tinapan-pt/VideoMoCo","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":84,"model":"3D-ResNet-18 (VideoMoCo)","metrics":{"3-fold Accuracy":"74.1"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/videomoco-contrastive-video-representation","paper_url":"https://arxiv.org/abs/2103.05905v2","paper_title":"VideoMoCo: Contrastive Video Representation Learning with Temporally Adversarial Examples","code":"https://github.com/tinapan-pt/VideoMoCo","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":85,"model":"Slow Fusion + Finetune top 3 layers","metrics":{"3-fold Accuracy":"65.4"},"uses_additional_data":true,"paper_date":"2014-06-23","paper":"/paper/large-scale-video-classification-with-1","paper_url":"https://doi.org/10.1109/CVPR.2014.223","paper_title":"Large-Scale Video Classification with Convolutional Neural Networks","code":"https://github.com/lRomul/ball-action-spotting","n_code_links":1,"syntology":null},{"rank_in_archive_order":86,"model":"MLGCN","metrics":{"3-fold Accuracy":"63.27"},"uses_additional_data":false,"paper_date":"2019-09-11","paper":"/paper/mlgcn-multi-laplacian-graph-convolutional","paper_url":"https://bmvc2019.org/wp-content/uploads/papers/1103-paper.pdf","paper_title":"MLGCN: Multi-Laplacian Graph Convolutional Networks for Human Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":87,"model":"CD-UAR","metrics":{"3-fold Accuracy":"42.5"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/towards-universal-representation-for-unseen","paper_url":"http://arxiv.org/abs/1803.08460v1","paper_title":"Towards Universal Representation for Unseen Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":88,"model":"SL","metrics":{"3-fold Accuracy":"35.2"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"I3D + PoTion","metrics":{"3-fold Accuracy":"29.3"},"uses_additional_data":false,"paper_date":"2018-06-01","paper":"/paper/potion-pose-motion-representation-for-action","paper_url":"http://openaccess.thecvf.com/content_cvpr_2018/html/Choutas_PoTion_Pose_MoTion_CVPR_2018_paper.html","paper_title":"PoTion: Pose MoTion Representation for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":90,"model":"R3D-18","metrics":{"Accuracy":"73.16"},"uses_additional_data":false,"paper_date":"2022-07-05","paper":"/paper/federated-self-supervised-learning-for-video","paper_url":"https://arxiv.org/abs/2207.01975v2","paper_title":"Federated Self-supervised Learning for Video Understanding","code":"https://github.com/adap/flower","n_code_links":2,"syntology":null},{"rank_in_archive_order":91,"model":"ResNet50","metrics":{"Accuracy 20%Test":"98.05"},"uses_additional_data":false,"paper_date":"2022-12-28","paper":"/paper/adaptive-frame-selection-in-two-dimensional","paper_url":"https://ieeexplore.ieee.org/document/10044032","paper_title":"Adaptive frame selection in two dimensional convolutional neural network action recognition","code":"https://github.com/Alirezarahnamaa/Adaptive-Frame-Selection-Algorithm","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":26,"rows_with_any_sample_ran":22,"distinct_papers_with_graph_line":14,"distinct_papers_with_any_sample_ran":10,"samples_over_distinct_papers":{"n_ran":39,"n_unverified":64,"n_samples":103,"n_pointer_only_licence":21,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":141,"n_unverified":151,"n_samples":292,"n_pointer_only_licence":84,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}