{"url":"/sota/self-supervised-action-recognition-on-hmdb51","task":{"name":"Self-Supervised Action Recognition","url":"/task/self-supervised-action-recognition","note":null},"dataset":{"name":"HMDB51","url":"/dataset/hmdb51"},"category":"Computer Vision","categories":["Computer Vision","Time Series"],"category_note":null,"description":null,"description_from":null,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top-1 Accuracy","Pre-Training Dataset","Frozen"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top-1 Accuracy":"higher","Pre-Training Dataset":null,"Frozen":null}},"counts":{"rows":48,"rows_with_code":41,"rows_with_paper_page":48,"rows_dated":48,"rows_using_additional_data":0},"rows":[{"rank_in_archive_order":1,"model":"MVD (ViT-B)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"79.7"},"uses_additional_data":false,"paper_date":"2022-12-08","paper":"/paper/masked-video-distillation-rethinking-masked","paper_url":"https://arxiv.org/abs/2212.04500v2","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","code":"https://github.com/ruiwang2021/mvd","n_code_links":4,"syntology":null},{"rank_in_archive_order":2,"model":"M3Video","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"78.0"},"uses_additional_data":false,"paper_date":"2022-10-12","paper":"/paper/m-3-video-masked-motion-modeling-for-self","paper_url":"https://arxiv.org/abs/2210.06096v2","paper_title":"Masked Motion Encoding for Self-Supervised Video Representation Learning","code":"https://github.com/XinyuSun/M3Video","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"pBYOL","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"75.0"},"uses_additional_data":false,"paper_date":"2021-04-29","paper":"/paper/a-large-scale-study-on-unsupervised","paper_url":"https://arxiv.org/abs/2104.14558v1","paper_title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","code":"https://github.com/facebookresearch/SlowFast","n_code_links":2,"syntology":null},{"rank_in_archive_order":4,"model":"SCE (R3D-50)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"74.7"},"uses_additional_data":false,"paper_date":"2022-12-21","paper":"/paper/similarity-contrastive-estimation-for-image","paper_url":"https://arxiv.org/abs/2212.11187v1","paper_title":"Similarity Contrastive Estimation for Image and Video Soft Contrastive Self-Supervised Learning","code":"https://github.com/juliendenize/eztorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":5,"model":"VideoMAE","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"73.3"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":6,"model":"BraVe:V-FA (TSM-50x2)","metrics":{"Frozen":"false","Top-1 Accuracy":"70.5"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/broaden-your-views-for-self-supervised-video","paper_url":"https://arxiv.org/abs/2103.16559v3","paper_title":"Broaden Your Views for Self-Supervised Video Learning","code":"https://github.com/deepmind/brave","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":8,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"CVRL (R3D-152 2x; K600)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics600","Top-1 Accuracy":"69.9"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":8,"model":"XKD (ViT-B/112/16)","metrics":{"Top-1 Accuracy":"69"},"uses_additional_data":false,"paper_date":"2022-11-25","paper":"/paper/xkd-cross-modal-knowledge-distillation-with","paper_url":"https://arxiv.org/abs/2211.13929v5","paper_title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","code":"https://github.com/pritamqu/XKD","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"XDC","metrics":{"Frozen":"false","Pre-Training Dataset":"IG-Kinetics","Top-1 Accuracy":"68.9"},"uses_additional_data":false,"paper_date":"2019-11-28","paper":"/paper/self-supervised-learning-by-cross-modal-audio","paper_url":"https://arxiv.org/abs/1911.12667v3","paper_title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","code":"https://github.com/HumamAlwassel/XDC","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"CVRL (R3D-50; K600)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics600","Top-1 Accuracy":"68.0"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":11,"model":"CrissCross (AudioSet)","metrics":{"Frozen":"false","Pre-Training Dataset":"AudioSet","Top-1 Accuracy":"66.8"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"CVRL (R3D-50; K400)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"66.7"},"uses_additional_data":false,"paper_date":"2020-08-09","paper":"/paper/spatiotemporal-contrastive-video","paper_url":"https://arxiv.org/abs/2008.03800v4","paper_title":"Spatiotemporal Contrastive Video Representation Learning","code":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl","n_code_links":4,"syntology":null},{"rank_in_archive_order":13,"model":"XDC","metrics":{"Frozen":"false","Pre-Training Dataset":"IG-Random","Top-1 Accuracy":"66.5"},"uses_additional_data":false,"paper_date":"2019-11-28","paper":"/paper/self-supervised-learning-by-cross-modal-audio","paper_url":"https://arxiv.org/abs/1911.12667v3","paper_title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","code":"https://github.com/HumamAlwassel/XDC","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"XKD-Modality-Agnostic (ViT-B/112/16)","metrics":{"Top-1 Accuracy":"65.9"},"uses_additional_data":false,"paper_date":"2022-11-25","paper":"/paper/xkd-cross-modal-knowledge-distillation-with","paper_url":"https://arxiv.org/abs/2211.13929v5","paper_title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","code":"https://github.com/pritamqu/XKD","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"VideoMS (ViT-B)","metrics":{"Frozen":"false","Pre-Training Dataset":"no extra data","Top-1 Accuracy":"65.8"},"uses_additional_data":false,"paper_date":"2022-11-19","paper":"/paper/efficient-video-representation-learning-via","paper_url":"https://arxiv.org/abs/2211.10636v6","paper_title":"EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens","code":"https://github.com/sunilhoho/everest","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":16,"model":"AVID+CMA (Modified R2+1D-18 on Audioset)","metrics":{"Frozen":"false","Pre-Training Dataset":"Audioset (Video+Audio)","Top-1 Accuracy":"64.7"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"RSPNet","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"64.7"},"uses_additional_data":false,"paper_date":"2020-10-27","paper":"/paper/rspnet-relative-speed-perception-for","paper_url":"https://arxiv.org/abs/2011.07949v2","paper_title":"RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning","code":"https://github.com/PeihaoChen/RSPNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"CrissCross (Kinetics400)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"64.7"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"ELo","metrics":{"Frozen":"false","Top-1 Accuracy":"64.5"},"uses_additional_data":false,"paper_date":"2020-02-26","paper":"/paper/evolving-losses-for-unsupervised-video","paper_url":"https://arxiv.org/abs/2002.12177v1","paper_title":"Evolving Losses for Unsupervised Video Representation Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":20,"model":"AVID (Modified R2+1D-18 on Audioset)","metrics":{"Frozen":"false","Pre-Training Dataset":"Audioset (Video+Audio)","Top-1 Accuracy":"64.1"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"XDC","metrics":{"Frozen":"false","Pre-Training Dataset":"AudioSet","Top-1 Accuracy":"63.7"},"uses_additional_data":false,"paper_date":"2019-11-28","paper":"/paper/self-supervised-learning-by-cross-modal-audio","paper_url":"https://arxiv.org/abs/1911.12667v3","paper_title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","code":"https://github.com/HumamAlwassel/XDC","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"VideoMAE(no extra data)","metrics":{"Frozen":"false","Pre-Training Dataset":"no extra data","Top-1 Accuracy":"62.6"},"uses_additional_data":false,"paper_date":"2022-03-23","paper":"/paper/videomae-masked-autoencoders-are-data-1","paper_url":"https://arxiv.org/abs/2203.12602v3","paper_title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","code":"https://github.com/huggingface/transformers","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":4,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":23,"model":"ViCC (S3D; R+F)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"62.2"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":24,"model":"ViCC (R2+1D; R+F)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"61.5"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"AVID+CMA (Modified R2+1D-18 on Kinetics)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400 (Video+Audio)","Top-1 Accuracy":"60.8"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":26,"model":"CrissCross (Kinetics-Sound)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics-Sound","Top-1 Accuracy":"60.5"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/self-supervised-audio-visual-representation","paper_url":"https://arxiv.org/abs/2111.05329v5","paper_title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","code":"https://github.com/pritamqu/CrissCross","n_code_links":1,"syntology":null},{"rank_in_archive_order":27,"model":"AVID (Modified R2+1D-18 on Kinetics)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400 (Video+Audio)","Top-1 Accuracy":"59.9"},"uses_additional_data":false,"paper_date":"2020-04-27","paper":"/paper/audio-visual-instance-discrimination-with","paper_url":"https://arxiv.org/abs/2004.12943v3","paper_title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","code":"https://github.com/facebookresearch/AVID-CMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"MCN (R3D-18; RGB)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"54.8"},"uses_additional_data":false,"paper_date":"2021-08-19","paper":"/paper/self-supervised-video-representation-learning-8","paper_url":"https://arxiv.org/abs/2108.08426v2","paper_title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"MCN (R2+1D; RGB)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"54.5"},"uses_additional_data":false,"paper_date":"2021-08-19","paper":"/paper/self-supervised-video-representation-learning-8","paper_url":"https://arxiv.org/abs/2108.08426v2","paper_title":"Self-Supervised Video Representation Learning with Meta-Contrastive Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":30,"model":"SLIC (R3D-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"54.5"},"uses_additional_data":false,"paper_date":"2022-06-25","paper":"/paper/slic-self-supervised-learning-with-iterative-1","paper_url":"https://arxiv.org/abs/2206.12534v1","paper_title":"SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos","code":"https://github.com/rvl-lab-utoronto/video_similarity_search","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"TCLR (R3D-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"52.9"},"uses_additional_data":false,"paper_date":"2021-01-20","paper":"/paper/tclr-temporal-contrastive-learning-for-video","paper_url":"https://arxiv.org/abs/2101.07974v4","paper_title":"TCLR: Temporal Contrastive Learning for Video Representation","code":"https://github.com/DAVEISHAN/TCLR","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"XDC","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"52.6"},"uses_additional_data":false,"paper_date":"2019-11-28","paper":"/paper/self-supervised-learning-by-cross-modal-audio","paper_url":"https://arxiv.org/abs/1911.12667v3","paper_title":"Self-Supervised Learning by Cross-Modal Audio-Video Clustering","code":"https://github.com/HumamAlwassel/XDC","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"ViCC (R2+1D; RGB)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"52.4"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"CoCLR","metrics":{"Frozen":"false","Top-1 Accuracy":"46.1"},"uses_additional_data":false,"paper_date":"2020-10-19","paper":"/paper/self-supervised-co-training-for-video","paper_url":"https://arxiv.org/abs/2010.09709v2","paper_title":"Self-supervised Co-training for Video Representation Learning","code":"https://github.com/TengdaHan/CoCLR","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"PCL (ResNet-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"43.2"},"uses_additional_data":false,"paper_date":"2020-10-29","paper":"/paper/self-supervised-video-representation-using","paper_url":"https://arxiv.org/abs/2010.15464v2","paper_title":"Pretext-Contrastive Learning: Toward Good Practices in Self-supervised Video Representation Leaning","code":"https://github.com/BestJuly/Pretext-Contrastive-Learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"ViCC (S3D; RGB)","metrics":{"Frozen":"true","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"38.5"},"uses_additional_data":false,"paper_date":"2021-06-18","paper":"/paper/self-supervised-video-representation-learning-7","paper_url":"https://arxiv.org/abs/2106.10137v3","paper_title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","code":"https://github.com/martinetoering/ViCC","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"IIC (R3D)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"38.3"},"uses_additional_data":false,"paper_date":"2020-08-06","paper":"/paper/self-supervised-video-representation-learning-3","paper_url":"https://arxiv.org/abs/2008.02531v2","paper_title":"Self-supervised Video Representation Learning Using Inter-intra Contrastive Framework","code":"https://github.com/BestJuly/Inter-intra-video-contrastive-learning","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":38,"model":"TCE (ResNet-50)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"36.6"},"uses_additional_data":false,"paper_date":"2020-03-21","paper":"/paper/temporally-coherent-embeddings-for-self","paper_url":"https://arxiv.org/abs/2004.02753v5","paper_title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","code":"https://github.com/csiro-robotics/TCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":39,"model":"DPC (Modified 3D Resnet-34)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"35.7"},"uses_additional_data":false,"paper_date":"2019-09-10","paper":"/paper/video-representation-learning-by-dense","paper_url":"https://arxiv.org/abs/1909.04656v3","paper_title":"Video Representation Learning by Dense Predictive Coding","code":"https://github.com/TengdaHan/DPC","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"DPC (Modified 3D ResNet-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"34.5"},"uses_additional_data":false,"paper_date":"2019-09-10","paper":"/paper/video-representation-learning-by-dense","paper_url":"https://arxiv.org/abs/1909.04656v3","paper_title":"Video Representation Learning by Dense Predictive Coding","code":"https://github.com/TengdaHan/DPC","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"TCE (ResNet-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"34.2"},"uses_additional_data":false,"paper_date":"2020-03-21","paper":"/paper/temporally-coherent-embeddings-for-self","paper_url":"https://arxiv.org/abs/2004.02753v5","paper_title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","code":"https://github.com/csiro-robotics/TCE","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":42,"model":"3D RotNet (3D ResNet-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"33.7"},"uses_additional_data":false,"paper_date":"2018-11-28","paper":"/paper/self-supervised-spatiotemporal-feature","paper_url":"http://arxiv.org/abs/1811.11387v2","paper_title":"Self-Supervised Spatiotemporal Feature Learning via Video Rotation Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":43,"model":"3D Cubic Puzzles (3D ResNet-18)","metrics":{"Frozen":"false","Pre-Training Dataset":"Kinetics400","Top-1 Accuracy":"33.7"},"uses_additional_data":false,"paper_date":"2018-11-24","paper":"/paper/self-supervised-video-representation-learning","paper_url":"http://arxiv.org/abs/1811.09795v1","paper_title":"Self-Supervised Video Representation Learning with Space-Time Cubic Puzzles","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":44,"model":"VCP (R3D)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"31.5"},"uses_additional_data":false,"paper_date":"2020-01-02","paper":"/paper/video-cloze-procedure-for-self-supervised","paper_url":"https://arxiv.org/abs/2001.00294v1","paper_title":"Video Cloze Procedure for Self-Supervised Spatio-Temporal Learning","code":"https://github.com/BestJuly/VCP","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":45,"model":"Video Clip Ordering (R3D)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"29.5"},"uses_additional_data":false,"paper_date":"2019-06-01","paper":"/paper/self-supervised-spatiotemporal-learning-via","paper_url":"http://openaccess.thecvf.com/content_CVPR_2019/html/Xu_Self-Supervised_Spatiotemporal_Learning_via_Video_Clip_Order_Prediction_CVPR_2019_paper.html","paper_title":"Self-Supervised Spatiotemporal Learning via Video Clip Order Prediction","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":46,"model":"OPN (VGG-M-2048)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"23.8"},"uses_additional_data":false,"paper_date":"2017-08-03","paper":"/paper/unsupervised-representation-learning-by","paper_url":"http://arxiv.org/abs/1708.01246v1","paper_title":"Unsupervised Representation Learning by Sorting Sequences","code":"https://github.com/HsinYingLee/OPN","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":47,"model":"Motion & Appearance (C3D)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"20.3"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/self-supervised-spatio-temporal","paper_url":"http://arxiv.org/abs/1904.03597v1","paper_title":"Self-supervised Spatio-temporal Representation Learning for Videos by Predicting Motion and Appearance Statistics","code":"https://github.com/laura-wang/video_repres_mas","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"Shuffle and Learn (AlexNet)","metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"19.8"},"uses_additional_data":false,"paper_date":"2016-03-28","paper":"/paper/shuffle-and-learn-unsupervised-learning-using","paper_url":"http://arxiv.org/abs/1603.08561v2","paper_title":"Shuffle and Learn: Unsupervised Learning using Temporal Order Verification","code":null,"n_code_links":0,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,264 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6264,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":3316},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":17,"rows_with_any_sample_ran":9,"distinct_papers_with_graph_line":11,"distinct_papers_with_any_sample_ran":7,"samples_over_distinct_papers":{"n_ran":22,"n_unverified":28,"n_samples":50,"n_pointer_only_licence":27,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":32,"n_unverified":46,"n_samples":78,"n_pointer_only_licence":40,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}