{"url":"/sota/self-supervised-action-recognition-on-ucf101","task":{"name":"Self-Supervised Action Recognition","url":"/task/self-supervised-action-recognition","note":null},"dataset":{"name":"UCF101","url":"/dataset/ucf101"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["3-fold Accuracy","Pre-Training Dataset","Frozen","split-1  Top-1 Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"3-fold Accuracy":"higher","Pre-Training Dataset":null,"Frozen":null,"split-1  Top-1 Accuracy":"higher"}},"counts":{"rows":53,"rows_with_code":42,"rows_with_paper_page":53,"rows_dated":53,"rows_using_additional_data":1},"rows":[{"rank_in_archive_order":1,"model":"VideoMAE V2-g","metrics":{"3-fold Accuracy":"99.6"},"uses_additional_data":true,"paper_date":"2023-03-29","paper":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_url":"https://arxiv.org/abs/2303.16727v2","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","code":"https://github.com/OpenGVLab/VideoMAEv2","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"MVD (ViT-B)","metrics":{"3-fold Accuracy":"97.5","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":3,"model":"SSL-KD (R21D-18)","metrics":{"3-fold Accuracy":"97.3","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/benchmarking-self-supervised-video","paper_url":"https://arxiv.org/abs/2306.06010v2","paper_title":"A Large-Scale Analysis on Self-Supervised Video Representation Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"M3Video","metrics":{"3-fold Accuracy":"96.5","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/m-3-video-masked-motion-modeling-for-self","paper_url":"https://arxiv.org/abs/2210.06096v2","paper_title":"Masked Motion Encoding for Self-Supervised Video Representation Learning","code":"https://github.com/XinyuSun/M3Video","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"pBYOL","metrics":{"3-fold Accuracy":"96.3","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2021-04-29","paper":"/paper/a-large-scale-study-on-unsupervised","paper_url":"https://arxiv.org/abs/2104.14558v1","paper_title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","code":"https://github.com/facebookresearch/SlowFast","n_code_links":2,"syntology":null},{"rank_in_archive_order":6,"model":"VideoMAE","metrics":{"3-fold Accuracy":"96.1","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":7,"model":"SCE (R3D-50)","metrics":{"3-fold Accuracy":"95.3","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2022-12-21","paper":"/paper/similarity-contrastive-estimation-for-image","paper_url":"https://arxiv.org/abs/2212.11187v1","paper_title":"Similarity Contrastive Estimation for Image and Video Soft Contrastive Self-Supervised Learning","code":"https://github.com/juliendenize/eztorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":8,"model":"MMV TSM-50x2","metrics":{"3-fold Accuracy":"95.2","Frozen":"false","Pre-Training Dataset":"Audioset + Howto100M"},"uses_additional_data":false,"paper_date":"2020-06-29","paper":"/paper/self-supervised-multimodal-versatile-networks","paper_url":"https://arxiv.org/abs/2006.16228v2","paper_title":"Self-Supervised MultiModal Versatile Networks","code":"https://github.com/deepmind/deepmind-research/tree/master/mmv","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"XKD (ViT-B/112/16)","metrics":{"3-fold Accuracy":"94.1","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2022-11-25","paper":"/paper/xkd-cross-modal-knowledge-distillation-with","paper_url":"https://arxiv.org/abs/2211.13929v5","paper_title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","code":"https://github.com/pritamqu/XKD","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"CVRL (R3D-152 2x; K600)","metrics":{"3-fold Accuracy":"93.9","Frozen":"false","Pre-Training Dataset":"Kinetics600"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":11,"model":"RSPNet","metrics":{"3-fold Accuracy":"93.7","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2020-10-27","paper":"/paper/rspnet-relative-speed-perception-for","paper_url":"https://arxiv.org/abs/2011.07949v2","paper_title":"RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning","code":"https://github.com/PeihaoChen/RSPNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"CVRL (R3D-50; K600)","metrics":{"3-fold Accuracy":"93.4","Frozen":"false","Pre-Training Dataset":"Kinetics600"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":13,"model":"VideoMS (ViT-B)","metrics":{"3-fold Accuracy":"93.4","Frozen":"false","Pre-Training Dataset":"no extra data"},"uses_additional_data":false,"paper_date":"2022-11-19","paper":"/paper/efficient-video-representation-learning-via","paper_url":"https://arxiv.org/abs/2211.10636v6","paper_title":"EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens","code":"https://github.com/sunilhoho/everest","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":14,"model":"XKD-Modality-Agnostic (ViT-B/112/16)","metrics":{"3-fold Accuracy":"93.4"},"uses_additional_data":false,"paper_date":"2022-11-25","paper":"/paper/xkd-cross-modal-knowledge-distillation-with","paper_url":"https://arxiv.org/abs/2211.13929v5","paper_title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","code":"https://github.com/pritamqu/XKD","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"BraVe:V-FA (TSM-50x2)","metrics":{"3-fold Accuracy":"93.1","Frozen":"false"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/broaden-your-views-for-self-supervised-video","paper_url":"https://arxiv.org/abs/2103.16559v3","paper_title":"Broaden Your Views for Self-Supervised Video Learning","code":"https://github.com/deepmind/brave","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"CrissCross (AudioSet)","metrics":{"3-fold Accuracy":"92.4","Frozen":"false","Pre-Training Dataset":"AudioSet"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"CVRL (R3D-50; K400)","metrics":{"3-fold Accuracy":"92.2","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":18,"model":"AVID+CMA (Modified R2+1D-18 on Audioset)","metrics":{"3-fold Accuracy":"91.5","Frozen":"false","Pre-Training Dataset":"Audioset (Audio+Video)"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"CrissCross (Kinetics400)","metrics":{"3-fold Accuracy":"91.5","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"VideoMAE(no extra data)","metrics":{"3-fold Accuracy":"91.3","Frozen":"false","Pre-Training Dataset":"no extra data"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":10,"n_unverified":3,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":21,"model":"AVID (Modified R2+1D-18 on Audioset)","metrics":{"3-fold Accuracy":"91.0","Frozen":"false","Pre-Training Dataset":"Audioset (Audio+Video)"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":22,"model":"ViCC (S3D; R+F)","metrics":{"3-fold Accuracy":"90.5","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":23,"model":"ViCC (S3D; RGB)","metrics":{"3-fold Accuracy":"88.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"ViCC (R2+1D; R+F)","metrics":{"3-fold Accuracy":"88.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"CrissCross (Kinetics-Sound)","metrics":{"3-fold Accuracy":"88.3","Frozen":"false","Pre-Training Dataset":"Kinetics-Sound"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"AVID+CMA (Modified R2+1D-18 on Kinetics)","metrics":{"3-fold Accuracy":"87.5","Frozen":"false","Pre-Training Dataset":"Kinetics400 (Audio+Video)"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"AVID (Modified R2+1D-18 on Kinetics)","metrics":{"3-fold Accuracy":"86.9","Frozen":"false","Pre-Training Dataset":"Kinetics400 (Audio+Video)"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"MCN (R3D-18; RGB)","metrics":{"3-fold Accuracy":"85.4"},"uses_additional_data":false,"paper_date":"2021-08-19","paper":"/paper/self-supervised-video-representation-learning-8","paper_url":"https://arxiv.org/abs/2108.08426v2","paper_title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"MCN (R2+1D; RGB)","metrics":{"3-fold Accuracy":"84.8"},"uses_additional_data":false,"paper_date":"2021-08-19","paper":"/paper/self-supervised-video-representation-learning-8","paper_url":"https://arxiv.org/abs/2108.08426v2","paper_title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"ViCC (R2+1D; RGB)","metrics":{"3-fold Accuracy":"82.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"TCLR (R3D-18)","metrics":{"3-fold Accuracy":"82.4","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-01-20","paper":"/paper/tclr-temporal-contrastive-learning-for-video","paper_url":"https://arxiv.org/abs/2101.07974v4","paper_title":"TCLR: Temporal Contrastive Learning for Video Representation","code":"https://github.com/DAVEISHAN/TCLR","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"PCL (ResNet-18)","metrics":{"3-fold Accuracy":"82.3","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2020-10-29","paper":"/paper/self-supervised-video-representation-using","paper_url":"https://arxiv.org/abs/2010.15464v2","paper_title":"Pretext-Contrastive Learning: Toward Good Practices in Self-supervised Video Representation Leaning","code":"https://github.com/BestJuly/Pretext-Contrastive-Learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"DPC (Modified 3D Resnet-34)","metrics":{"3-fold Accuracy":"75.7","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2019-09-10","paper":"/paper/video-representation-learning-by-dense","paper_url":"https://arxiv.org/abs/1909.04656v3","paper_title":"Video Representation Learning by Dense Predictive Coding","code":"https://github.com/TengdaHan/DPC","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"CoCLR","metrics":{"3-fold Accuracy":"74.5","Frozen":"false"},"uses_additional_data":false,"paper_date":"2020-10-19","paper":"/paper/self-supervised-co-training-for-video","paper_url":"https://arxiv.org/abs/2010.09709v2","paper_title":"Self-supervised Co-training for Video Representation Learning","code":"https://github.com/TengdaHan/CoCLR","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"IIC (R3D)","metrics":{"3-fold Accuracy":"74.4","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2020-08-06","paper":"/paper/self-supervised-video-representation-learning-3","paper_url":"https://arxiv.org/abs/2008.02531v2","paper_title":"Self-supervised Video Representation Learning Using Inter-intra Contrastive Framework","code":"https://github.com/BestJuly/Inter-intra-video-contrastive-learning","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":36,"model":"ViCC (S3D; RGB)","metrics":{"3-fold Accuracy":"72.2","Frozen":"true","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"TCE (ResNet-50)","metrics":{"3-fold Accuracy":"71.2","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2020-03-21","paper":"/paper/temporally-coherent-embeddings-for-self","paper_url":"https://arxiv.org/abs/2004.02753v5","paper_title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","code":"https://github.com/csiro-robotics/TCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":38,"model":"TCE (ResNet-18, Split 1)","metrics":{"3-fold Accuracy":"68.8","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2020-03-21","paper":"/paper/temporally-coherent-embeddings-for-self","paper_url":"https://arxiv.org/abs/2004.02753v5","paper_title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","code":"https://github.com/csiro-robotics/TCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":39,"model":"DPC (3D ResNet-18)","metrics":{"3-fold Accuracy":"68.2","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2019-09-10","paper":"/paper/video-representation-learning-by-dense","paper_url":"https://arxiv.org/abs/1909.04656v3","paper_title":"Video Representation Learning by Dense Predictive Coding","code":"https://github.com/TengdaHan/DPC","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"TCE (ResNet18, Split 1)","metrics":{"3-fold Accuracy":"68.2","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2020-03-21","paper":"/paper/temporally-coherent-embeddings-for-self","paper_url":"https://arxiv.org/abs/2004.02753v5","paper_title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","code":"https://github.com/csiro-robotics/TCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":41,"model":"VCP (R3D)","metrics":{"3-fold Accuracy":"66","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2020-01-02","paper":"/paper/video-cloze-procedure-for-self-supervised","paper_url":"https://arxiv.org/abs/2001.00294v1","paper_title":"Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning","code":"https://github.com/BestJuly/VCP","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":42,"model":"3D Cubic Puzzles (3D ResNet-18)","metrics":{"3-fold Accuracy":"65.8","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2018-11-24","paper":"/paper/self-supervised-video-representation-learning","paper_url":"http://arxiv.org/abs/1811.09795v1","paper_title":"Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"Video Clip Ordering (R3D)","metrics":{"3-fold Accuracy":"64.9","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/self-supervised-spatiotemporal-learning-via","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Xu_Self-Supervised_Spatiotemporal_Learning_via_Video_Clip_Order_Prediction_CVPR_2019_paper.html","paper_title":"Self-Supervised Spatiotemporal Learning via Video Clip Order Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"Skip-Clip (3D ResNet-18)","metrics":{"3-fold Accuracy":"64.4","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2019-10-28","paper":"/paper/skip-clip-self-supervised-spatiotemporal","paper_url":"https://arxiv.org/abs/1910.12770v1","paper_title":"Skip-Clip: Self-Supervised Spatiotemporal Representation Learning by Future Clip Order Ranking","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":45,"model":"3D RotNet (3D ResNet-18)","metrics":{"3-fold Accuracy":"62.9","Frozen":"false","Pre-Training Dataset":"Kinetics400"},"uses_additional_data":false,"paper_date":"2018-11-28","paper":"/paper/self-supervised-spatiotemporal-feature","paper_url":"http://arxiv.org/abs/1811.11387v2","paper_title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":46,"model":"DPC (3D ResNet-18, Split 1)","metrics":{"3-fold Accuracy":"60.6","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2019-09-10","paper":"/paper/video-representation-learning-by-dense","paper_url":"https://arxiv.org/abs/1909.04656v3","paper_title":"Video Representation Learning by Dense Predictive Coding","code":"https://github.com/TengdaHan/DPC","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"O3N (AlexNet)","metrics":{"3-fold Accuracy":"60.3","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2016-11-21","paper":"/paper/self-supervised-video-representation-learning-1","paper_url":"http://arxiv.org/abs/1611.06646v4","paper_title":"Self-Supervised Video Representation Learning With Odd-One-Out Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":48,"model":"Contrastive Multiview Coding (CaffeNet x2)","metrics":{"3-fold Accuracy":"59.1","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2019-06-13","paper":"/paper/contrastive-multiview-coding","paper_url":"https://arxiv.org/abs/1906.05849v5","paper_title":"Contrastive Multiview Coding","code":"https://github.com/HobbitLong/PyContrast","n_code_links":8,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":1}},{"rank_in_archive_order":49,"model":"Motion & Appearance (C3D)","metrics":{"3-fold Accuracy":"58.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/self-supervised-spatio-temporal","paper_url":"http://arxiv.org/abs/1904.03597v1","paper_title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","code":"https://github.com/laura-wang/video_repres_mas","n_code_links":1,"syntology":null},{"rank_in_archive_order":50,"model":"Arrow of Time (AlexNet)","metrics":{"3-fold Accuracy":"55.3","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2018-06-01","paper":"/paper/learning-and-using-the-arrow-of-time","paper_url":"http://openaccess.thecvf.com/content_cvpr_2018/html/Wei_Learning_and_Using_CVPR_2018_paper.html","paper_title":"Learning and Using the Arrow of Time","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":51,"model":"VideoGan (C3D)","metrics":{"3-fold Accuracy":"52.1","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2016-09-08","paper":"/paper/generating-videos-with-scene-dynamics","paper_url":"http://arxiv.org/abs/1609.02612v3","paper_title":"Generating Videos with Scene Dynamics","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"Shuffle and Learn (AlexNet)","metrics":{"3-fold Accuracy":"50.9","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false,"paper_date":"2016-03-28","paper":"/paper/shuffle-and-learn-unsupervised-learning-using","paper_url":"http://arxiv.org/abs/1603.08561v2","paper_title":"Shuffle and Learn: Unsupervised Learning using Temporal Order Verification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"SLIC (R3D-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","split-1  Top-1 Accuracy":"83.2"},"uses_additional_data":false,"paper_date":"2022-06-25","paper":"/paper/slic-self-supervised-learning-with-iterative-1","paper_url":"https://arxiv.org/abs/2206.12534v1","paper_title":"SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos","code":"https://github.com/rvl-lab-utoronto/video_similarity_search","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":16,"rows_with_any_sample_ran":12,"distinct_papers_with_graph_line":11,"distinct_papers_with_any_sample_ran":9,"samples_over_distinct_papers":{"n_ran":33,"n_unverified":25,"n_samples":58,"n_pointer_only_licence":27,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":45,"n_unverified":50,"n_samples":95,"n_pointer_only_licence":41,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}