{"url":"/sota/action-classification-on-charades","task":{"name":"Action Classification","url":"/task/action-classification","note":null},"dataset":{"name":"Charades","url":"/dataset/charades"},"category":"Computer Vision","categories":["Computer Vision"],"category_note":null,"description":"Image source: [The Kinetics Human Action Video Dataset](https://arxiv.org/pdf/1705.06950.pdf)","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["MAP","FLOPs (G) x views"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"MAP":"higher","FLOPs (G) x views":"lower"}},"counts":{"rows":49,"rows_with_code":35,"rows_with_paper_page":49,"rows_dated":49,"rows_using_additional_data":7},"rows":[{"rank_in_archive_order":1,"model":"TokenLearner","metrics":{"MAP":"66.3"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_url":"https://arxiv.org/abs/2106.11297v4","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","code":"https://github.com/google-research/scenic","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"TubeViT-L","metrics":{"MAP":"66.2"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/rethinking-video-vits-sparse-video-tubes-for","paper_url":"https://arxiv.org/abs/2212.03229v1","paper_title":"Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video Learning","code":"https://github.com/daniel-code/TubeViT","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"MoViNet-A6","metrics":{"MAP":"63.2"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"DEEP-HAL with ODF+SDF (AssembleNet++)","metrics":{"MAP":"62.29"},"uses_additional_data":false,"paper_date":"2020-01-14","paper":"/paper/hallucinating-statistical-moment-and-subspace","paper_url":"https://arxiv.org/abs/2001.04627v2","paper_title":"Self-supervising Action Recognition by Statistical Moment and Subspace Descriptors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":5,"model":"AssembleNet++ 50","metrics":{"MAP":"59.8"},"uses_additional_data":false,"paper_date":"2020-08-18","paper":"/paper/assemblenet-assembling-modality","paper_url":"https://arxiv.org/abs/2008.08072v1","paper_title":"AssembleNet++: Assembling Modality Representations via Attention Connections","code":"https://github.com/google-research/google-research/tree/master/assemblenet","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"AssembleNet","metrics":{"MAP":"58.6"},"uses_additional_data":true,"paper_date":"2019-05-30","paper":"/paper/assemblenet-searching-for-multi-stream-neural","paper_url":"https://arxiv.org/abs/1905.13209v4","paper_title":"AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/assemblenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":7,"model":"AssembleNet-101","metrics":{"MAP":"58.6"},"uses_additional_data":false,"paper_date":"2019-05-30","paper":"/paper/assemblenet-searching-for-multi-stream-neural","paper_url":"https://arxiv.org/abs/1905.13209v4","paper_title":"AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/assemblenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"VicTR (ViT-L/14)","metrics":{"MAP":"57.6"},"uses_additional_data":false,"paper_date":"2023-04-05","paper":"/paper/victr-video-conditioned-text-representations","paper_url":"https://arxiv.org/abs/2304.02560v2","paper_title":"VicTR: Video-conditioned Text Representations for Activity Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":9,"model":"AssembleNet++ 50 without object","metrics":{"MAP":"54.98"},"uses_additional_data":false,"paper_date":"2020-08-18","paper":"/paper/assemblenet-assembling-modality","paper_url":"https://arxiv.org/abs/2008.08072v1","paper_title":"AssembleNet++: Assembling Modality Representations via Attention Connections","code":"https://github.com/google-research/google-research/tree/master/assemblenet","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"BIKE","metrics":{"MAP":"50.7"},"uses_additional_data":false,"paper_date":"2022-12-31","paper":"/paper/bidirectional-cross-modal-knowledge","paper_url":"https://arxiv.org/abs/2301.00182v2","paper_title":"Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models","code":"https://github.com/whwu95/Cap4Video","n_code_links":5,"syntology":null},{"rank_in_archive_order":11,"model":"DEEP-HAL with ODF+SDF (I3D)","metrics":{"MAP":"50.16"},"uses_additional_data":false,"paper_date":"2020-01-14","paper":"/paper/hallucinating-statistical-moment-and-subspace","paper_url":"https://arxiv.org/abs/2001.04627v2","paper_title":"Self-supervising Action Recognition by Statistical Moment and Subspace Descriptors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"MoViNet-A4","metrics":{"MAP":"48.5"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"AdaFocus (weak supervision, MViT-B-24, 32x3)","metrics":{"MAP":"47.8"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/adafocus-towards-end-to-end-weakly-supervised","paper_url":"https://arxiv.org/abs/2311.17118v2","paper_title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":14,"model":"MViT-B-24, 32x3 (Kinetics-600 pretraining)","metrics":{"MAP":"47.7"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":15,"model":"En-VidTr-L","metrics":{"MAP":"47.3"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"MViT-B, 32x3 (Kinetics-600 pretraining)","metrics":{"MAP":"47.1"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":17,"model":"MViT-B-24, 32x3 (Kinetics-400 pretraining)","metrics":{"MAP":"46.3"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":18,"model":"SlowFast (Kinetics-600 pretraining, NL)","metrics":{"MAP":"45.2"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"MViT-B, 32x3 (Kinetics-400 pretraining)","metrics":{"MAP":"44.3"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":20,"model":"ActionCLIP (ViT-B/16)","metrics":{"MAP":"44.3"},"uses_additional_data":false,"paper_date":"2021-09-17","paper":"/paper/actionclip-a-new-paradigm-for-video-action","paper_url":"https://arxiv.org/abs/2109.08472v1","paper_title":"ActionCLIP: A New Paradigm for Video Action Recognition","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":21,"model":"MViT-B, 16x4 (Kinetics-600 pretraining)","metrics":{"MAP":"43.9"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":22,"model":"VidTr-L","metrics":{"MAP":"43.5"},"uses_additional_data":false,"paper_date":"2021-04-23","paper":"/paper/vidtr-video-transformer-without-convolutions","paper_url":"https://arxiv.org/abs/2104.11746v2","paper_title":"VidTr: Video Transformer Without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"JMRN + R101-NL-LFB","metrics":{"MAP":"43.23"},"uses_additional_data":false,"paper_date":"2020-10-16","paper":"/paper/pose-and-joint-aware-action-recognition","paper_url":"https://arxiv.org/abs/2010.08164v2","paper_title":"Pose And Joint-Aware Action Recognition","code":"https://github.com/anshulbshah/PoseAction","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"HAF+BoW/FV/OFF halluc. +MSK×8/PN","metrics":{"MAP":"43.1"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/hallucinating-bag-of-words-and-fisher-vector","paper_url":"https://arxiv.org/abs/1906.05910v2","paper_title":"Hallucinating IDT Descriptors and I3D Optical Flow Features for Action Recognition with CNNs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":25,"model":"LFB","metrics":{"MAP":"42.5"},"uses_additional_data":true,"paper_date":"2018-12-12","paper":"/paper/long-term-feature-banks-for-detailed-video","paper_url":"http://arxiv.org/abs/1812.05038v2","paper_title":"Long-Term Feature Banks for Detailed Video Understanding","code":"https://github.com/open-mmlab/mmaction2","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"SlowFast (Kinetics-400 pretraining, NL)","metrics":{"MAP":"42.5"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"SlowFast (Kinetics-600 pretraining)","metrics":{"MAP":"42.1"},"uses_additional_data":false,"paper_date":"2018-12-10","paper":"/paper/slowfast-networks-for-video-recognition","paper_url":"https://arxiv.org/abs/1812.03982v3","paper_title":"SlowFast Networks for Video Recognition","code":"https://github.com/facebookresearch/SlowFast","n_code_links":15,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":28,"model":"AdaFocus (weak supervision, MViT-B-K400-pretrain, 16x4)","metrics":{"MAP":"41.4"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/adafocus-towards-end-to-end-weakly-supervised","paper_url":"https://arxiv.org/abs/2311.17118v2","paper_title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"AdaFocus (weak supervision, X3D-L, 32x3)","metrics":{"MAP":"41.2"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/adafocus-towards-end-to-end-weakly-supervised","paper_url":"https://arxiv.org/abs/2311.17118v2","paper_title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"Timeception (R3D)","metrics":{"MAP":"41.1"},"uses_additional_data":false,"paper_date":"2018-12-04","paper":"/paper/timeception-for-complex-action-recognition","paper_url":"http://arxiv.org/abs/1812.01289v2","paper_title":"Timeception for Complex Action Recognition","code":"https://github.com/noureldien/timeception","n_code_links":3,"syntology":null},{"rank_in_archive_order":31,"model":"PA3D + (GCN + I3D + NL I3D)","metrics":{"MAP":"41"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/pa3d-pose-action-3d-machine-for-video","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Yan_PA3D_Pose-Action_3D_Machine_for_Video_Recognition_CVPR_2019_paper.html","paper_title":"PA3D: Pose-Action 3D Machine for Video Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":32,"model":"PoTion + (GCN + I3D + NL I3D)","metrics":{"MAP":"40.8"},"uses_additional_data":false,"paper_date":"2018-06-01","paper":"/paper/potion-pose-motion-representation-for-action","paper_url":"http://openaccess.thecvf.com/content_cvpr_2018/html/Choutas_PoTion_Pose_MoTion_CVPR_2018_paper.html","paper_title":"PoTion: Pose MoTion Representation for Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":33,"model":"MViT-B, 16x4 (Kinetics-400 pretraining)","metrics":{"MAP":"40"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":34,"model":"STRG","metrics":{"MAP":"39.7"},"uses_additional_data":true,"paper_date":"2018-06-05","paper":"/paper/videos-as-space-time-region-graphs","paper_url":"http://arxiv.org/abs/1806.01810v2","paper_title":"Videos as Space-Time Region Graphs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":35,"model":"AdaFocus (weak supervision, Slowfast-R50, 16x8)","metrics":{"MAP":"39.3"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/adafocus-towards-end-to-end-weakly-supervised","paper_url":"https://arxiv.org/abs/2311.17118v2","paper_title":"Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":36,"model":"STLT + I3D","metrics":{"MAP":"38.5"},"uses_additional_data":false,"paper_date":"2021-11-02","paper":"/paper/revisiting-spatio-temporal-layouts-for","paper_url":"https://arxiv.org/abs/2111.01936v1","paper_title":"Revisiting spatio-temporal layouts for compositional action recognition","code":"https://github.com/gorjanradevski/revisiting-spatial-temporal-layouts","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"EvaNet","metrics":{"MAP":"38.1"},"uses_additional_data":true,"paper_date":"2018-11-26","paper":"/paper/evolving-space-time-neural-architectures-for","paper_url":"https://arxiv.org/abs/1811.10636v2","paper_title":"Evolving Space-Time Neural Architectures for Videos","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":38,"model":"Timeception (I3D)","metrics":{"MAP":"37.2"},"uses_additional_data":false,"paper_date":"2018-12-04","paper":"/paper/timeception-for-complex-action-recognition","paper_url":"http://arxiv.org/abs/1812.01289v2","paper_title":"Timeception for Complex Action Recognition","code":"https://github.com/noureldien/timeception","n_code_links":3,"syntology":null},{"rank_in_archive_order":39,"model":"I3D","metrics":{"MAP":"32.9"},"uses_additional_data":false,"paper_date":"2017-05-22","paper":"/paper/quo-vadis-action-recognition-a-new-model-and","paper_url":"http://arxiv.org/abs/1705.07750v3","paper_title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","code":"https://github.com/open-mmlab/mmaction2","n_code_links":34,"syntology":{"n_ran":16,"n_unverified":12,"n_samples":28,"n_pointer_only_licence":7}},{"rank_in_archive_order":40,"model":"MoViNet-A2","metrics":{"MAP":"32.5"},"uses_additional_data":false,"paper_date":"2021-03-21","paper":"/paper/movinets-mobile-video-networks-for-efficient","paper_url":"https://arxiv.org/abs/2103.11511v2","paper_title":"MoViNets: Mobile Video Networks for Efficient Video Recognition","code":"https://github.com/tensorflow/models","n_code_links":3,"syntology":{"n_ran":8,"n_unverified":5,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"Timeception (R2D)","metrics":{"MAP":"31.6"},"uses_additional_data":false,"paper_date":"2018-12-04","paper":"/paper/timeception-for-complex-action-recognition","paper_url":"http://arxiv.org/abs/1812.01289v2","paper_title":"Timeception for Complex Action Recognition","code":"https://github.com/noureldien/timeception","n_code_links":3,"syntology":null},{"rank_in_archive_order":42,"model":"MultiScale TRN","metrics":{"MAP":"25.2"},"uses_additional_data":true,"paper_date":"2017-11-22","paper":"/paper/temporal-relational-reasoning-in-videos","paper_url":"http://arxiv.org/abs/1711.08496v2","paper_title":"Temporal Relational Reasoning in Videos","code":"https://github.com/metalbubble/TRN-pytorch","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":43,"model":"Co Slow_64","metrics":{"FLOPs (G) x views":"6.9x1","MAP":"25.2"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"Slow-8×8","metrics":{"FLOPs (G) x views":"54.9x1","MAP":"24.1"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"Asyn-TF","metrics":{"MAP":"22.4"},"uses_additional_data":true,"paper_date":"2016-12-19","paper":"/paper/asynchronous-temporal-fields-for-action","paper_url":"http://arxiv.org/abs/1612.06371v2","paper_title":"Asynchronous Temporal Fields for Action Recognition","code":"https://github.com/gsig/charades-algorithms","n_code_links":2,"syntology":null},{"rank_in_archive_order":46,"model":"CoViAR","metrics":{"MAP":"21.9"},"uses_additional_data":true,"paper_date":"2017-12-02","paper":"/paper/compressed-video-action-recognition","paper_url":"http://arxiv.org/abs/1712.00636v2","paper_title":"Compressed Video Action Recognition","code":"https://github.com/chaoyuaw/pytorch-coviar","n_code_links":1,"syntology":null},{"rank_in_archive_order":47,"model":"Co Slow_8","metrics":{"FLOPs (G) x views":"6.9x1","MAP":"21.5"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/continual-3d-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2106.00050v3","paper_title":"Continual 3D Convolutional Neural Networks for Real-time Processing of Videos","code":"https://github.com/LukasHedegaard/co3d","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"2-Strm","metrics":{"MAP":"18.6"},"uses_additional_data":false,"paper_date":"2014-06-09","paper":"/paper/two-stream-convolutional-networks-for-action","paper_url":"http://arxiv.org/abs/1406.2199v2","paper_title":"Two-Stream Convolutional Networks for Action Recognition in Videos","code":"https://github.com/feichtenhofer/twostreamfusion","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":2}},{"rank_in_archive_order":49,"model":"JMRN (Pose only)","metrics":{"MAP":"16.2"},"uses_additional_data":false,"paper_date":"2020-10-16","paper":"/paper/pose-and-joint-aware-action-recognition","paper_url":"https://arxiv.org/abs/2010.08164v2","paper_title":"Pose And Joint-Aware Action Recognition","code":"https://github.com/anshulbshah/PoseAction","n_code_links":1,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":19,"rows_with_any_sample_ran":15,"distinct_papers_with_graph_line":10,"distinct_papers_with_any_sample_ran":8,"samples_over_distinct_papers":{"n_ran":49,"n_unverified":61,"n_samples":110,"n_pointer_only_licence":17,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":130,"n_unverified":156,"n_samples":286,"n_pointer_only_licence":42,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}