{"url":"/task/self-supervised-action-recognition","name":"Self-Supervised Action Recognition","slug":"self-supervised-action-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"},{"name":"Time Series","url":"/area/time-series"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":51,"papers_with_code":35,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":5,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","slug":"self-supervised-action-recognition-on-ucf101","dataset":"UCF101","dataset_url":"/dataset/ucf101","rows_in_archive":53,"metrics":["3-fold Accuracy","Pre-Training Dataset","Frozen","split-1  Top-1 Accuracy"],"first_row_in_archive_order":{"model":"VideoMAE V2-g","paper_title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","paper_url":"/paper/videomae-v2-scaling-video-masked-autoencoders","paper_date":"2023-03-29","arxiv_id":"2303.16727","code_links":[{"title":"OpenGVLab/VideoMAEv2","url":"https://github.com/OpenGVLab/VideoMAEv2"}],"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}}},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","slug":"self-supervised-action-recognition-on-hmdb51","dataset":"HMDB51","dataset_url":"/dataset/hmdb51","rows_in_archive":48,"metrics":["Top-1 Accuracy","Pre-Training Dataset","Frozen"],"first_row_in_archive_order":{"model":"MVD (ViT-B)","paper_title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","paper_url":"/paper/masked-video-distillation-rethinking-masked","paper_date":"2022-12-08","arxiv_id":"2212.04500","code_links":[{"title":"ruiwang2021/mvd","url":"https://github.com/ruiwang2021/mvd"},{"title":"2023-MindSpore-4/Code-5","url":"https://github.com/2023-MindSpore-4/Code-5/tree/main/MVD"},{"title":"Mind23-2/MindCode-3","url":"https://github.com/Mind23-2/MindCode-3/tree/main/MVD"},{"title":"Mind23-2/MindCode-101","url":"https://github.com/Mind23-2/MindCode-101/tree/main/MVD"}],"syntology":null}},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51-1","slug":"self-supervised-action-recognition-on-hmdb51-1","dataset":"HMDB51 (finetuned)","dataset_url":"/dataset/hmdb51","rows_in_archive":14,"metrics":["Top-1 Accuracy","Pretraining Dataset"],"first_row_in_archive_order":{"model":"BraVe:V-FA (TSM-50x2)","paper_title":"Broaden Your Views for Self-Supervised Video Learning","paper_url":"/paper/broaden-your-views-for-self-supervised-video","paper_date":"2021-03-30","arxiv_id":"2103.16559","code_links":[{"title":"deepmind/brave","url":"https://github.com/deepmind/brave"}],"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","slug":"self-supervised-action-recognition-on-ucf101-1","dataset":"UCF101 (finetuned)","dataset_url":"/dataset/ucf101","rows_in_archive":14,"metrics":["3-fold Accuracy","Pretrain"],"first_row_in_archive_order":{"model":"BraVe:V-FA (TSM-50x2)","paper_title":"Broaden Your Views for Self-Supervised Video Learning","paper_url":"/paper/broaden-your-views-for-self-supervised-video","paper_date":"2021-03-30","arxiv_id":"2103.16559","code_links":[{"title":"deepmind/brave","url":"https://github.com/deepmind/brave"}],"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":0}}},{"leaderboard":"/sota/self-supervised-action-recognition-on","slug":"self-supervised-action-recognition-on","dataset":"Kinetics-600","dataset_url":"/dataset/kinetics-600","rows_in_archive":5,"metrics":["Top-1 Accuracy"],"first_row_in_archive_order":{"model":"CVRL (R3D-152 2x)","paper_title":"Spatiotemporal Contrastive Video Representation Learning","paper_url":"/paper/spatiotemporal-contrastive-video","paper_date":"2020-08-09","arxiv_id":"2008.03800","code_links":[{"title":"tensorflow/models","url":"https://github.com/tensorflow/models/tree/master/official/projects/video_ssl"},{"title":"ed-fish/spatio-temporal-contrastive-film","url":"https://github.com/ed-fish/spatio-temporal-contrastive-film"},{"title":"ed-fish/spatio-temporal-contrastive-video","url":"https://github.com/ed-fish/spatio-temporal-contrastive-video"},{"title":"applecrumble123/CVLR_pytorch","url":"https://github.com/applecrumble123/CVLR_pytorch"}],"syntology":null}},{"leaderboard":"/sota/self-supervised-action-recognition-on-1","slug":"self-supervised-action-recognition-on-1","dataset":"Kinetics-400","dataset_url":"/dataset/kinetics","rows_in_archive":4,"metrics":["Top-1 accuracy %","Top-5 Accuracy %"],"first_row_in_archive_order":{"model":"XKD (ViT-B/112/16)","paper_title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","paper_url":"/paper/xkd-cross-modal-knowledge-distillation-with","paper_date":"2022-11-25","arxiv_id":"2211.13929","code_links":[{"title":"pritamqu/XKD","url":"https://github.com/pritamqu/XKD"}],"syntology":null}}],"datasets":[{"url":"/dataset/ucf101","name":"UCF101","full_name":"UCF101 Human Actions dataset","num_papers_in_archive":1863},{"url":"/dataset/kinetics","name":"Kinetics","full_name":"Kinetics Human Action Video Dataset","num_papers_in_archive":1341},{"url":"/dataset/hmdb51","name":"HMDB51","full_name":"","num_papers_in_archive":839},{"url":"/dataset/kinetics-400-1","name":"Kinetics 400","full_name":"","num_papers_in_archive":712},{"url":"/dataset/kinetics-600","name":"Kinetics-600","full_name":"","num_papers_in_archive":148}],"subtasks":[],"parent_tasks":[{"url":"/task/action-recognition-in-videos","name":"Action Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":35,"tagged_in_all":51,"items":[{"url":"/paper/videomae-masked-autoencoders-are-data-1","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","date":"2022-03-23","arxiv_id":"2203.12602","repositories_listed":9,"syntology":{"n":13,"n_ran":10,"n_unverified":3,"n_pointer_only":12}},{"url":"/paper/contrastive-multiview-coding","title":"Contrastive Multiview Coding","date":"2019-06-13","arxiv_id":"1906.05849","repositories_listed":8,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/masked-video-distillation-rethinking-masked","title":"Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning","date":"2022-12-08","arxiv_id":"2212.04500","repositories_listed":4,"syntology":null},{"url":"/paper/spatiotemporal-contrastive-video","title":"Spatiotemporal Contrastive Video Representation Learning","date":"2020-08-09","arxiv_id":"2008.03800","repositories_listed":4,"syntology":null},{"url":"/paper/joint-adversarial-and-collaborative-learning","title":"Cross-Model Cross-Stream Learning for Self-Supervised Human Action Recognition","date":"2023-07-15","arxiv_id":"2307.07791","repositories_listed":2,"syntology":null},{"url":"/paper/similarity-contrastive-estimation-for-image","title":"Similarity Contrastive Estimation for Image and Video Soft Contrastive Self-Supervised Learning","date":"2022-12-21","arxiv_id":"2212.11187","repositories_listed":2,"syntology":null},{"url":"/paper/efficient-video-representation-learning-via","title":"EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens","date":"2022-11-19","arxiv_id":"2211.10636","repositories_listed":2,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":6}},{"url":"/paper/m-3-video-masked-motion-modeling-for-self","title":"Masked Motion Encoding for Self-Supervised Video Representation Learning","date":"2022-10-12","arxiv_id":"2210.06096","repositories_listed":2,"syntology":null},{"url":"/paper/a-large-scale-study-on-unsupervised","title":"A Large-Scale Study on Unsupervised Spatiotemporal Representation Learning","date":"2021-04-29","arxiv_id":"2104.14558","repositories_listed":2,"syntology":null},{"url":"/paper/self-supervised-video-representation-learning-3","title":"Self-supervised Video Representation Learning Using Inter-intra Contrastive Framework","date":"2020-08-06","arxiv_id":"2008.02531","repositories_listed":2,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":4}},{"url":"/paper/part-aware-contrastive-learning-for-self","title":"Part Aware Contrastive Learning for Self-Supervised Action Recognition","date":"2023-05-01","arxiv_id":"2305.00666","repositories_listed":1,"syntology":{"n":12,"n_ran":6,"n_unverified":6,"n_pointer_only":12}},{"url":"/paper/videomae-v2-scaling-video-masked-autoencoders","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","date":"2023-03-29","arxiv_id":"2303.16727","repositories_listed":1,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/self-supervised-action-representation","title":"Self-supervised Action Representation Learning from Partial Spatio-Temporal Skeleton Sequences","date":"2023-02-17","arxiv_id":"2302.09018","repositories_listed":1,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/xkd-cross-modal-knowledge-distillation-with","title":"XKD: Cross-modal Knowledge Distillation with Domain Alignment for Video Representation Learning","date":"2022-11-25","arxiv_id":"2211.13929","repositories_listed":1,"syntology":null},{"url":"/paper/slic-self-supervised-learning-with-iterative-1","title":"SLIC: Self-Supervised Learning with Iterative Clustering for Human Action Videos","date":"2022-06-25","arxiv_id":"2206.12534","repositories_listed":1,"syntology":null},{"url":"/paper/contrastive-learning-from-extremely-augmented","title":"Contrastive Learning from Extremely Augmented Skeleton Sequences for Self-supervised Action Recognition","date":"2021-12-07","arxiv_id":"2112.03590","repositories_listed":1,"syntology":null},{"url":"/paper/self-supervised-audio-visual-representation","title":"Self-Supervised Audio-Visual Representation Learning with Relaxed Cross-Modal Synchronicity","date":"2021-11-09","arxiv_id":"2111.05329","repositories_listed":1,"syntology":null},{"url":"/paper/learning-the-predictability-of-the-future","title":"Learning the Predictability of the Future","date":"2021-06-19","arxiv_id":"2101.01600","repositories_listed":1,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/self-supervised-video-representation-learning-7","title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","date":"2021-06-18","arxiv_id":"2106.10137","repositories_listed":1,"syntology":null},{"url":"/paper/broaden-your-views-for-self-supervised-video","title":"Broaden Your Views for Self-Supervised Video Learning","date":"2021-03-30","arxiv_id":"2103.16559","repositories_listed":1,"syntology":{"n":8,"n_ran":5,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/tclr-temporal-contrastive-learning-for-video","title":"TCLR: Temporal Contrastive Learning for Video Representation","date":"2021-01-20","arxiv_id":"2101.07974","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/self-supervised-video-representation-using","title":"Pretext-Contrastive Learning: Toward Good Practices in Self-supervised Video Representation Leaning","date":"2020-10-29","arxiv_id":"2010.15464","repositories_listed":1,"syntology":null},{"url":"/paper/rspnet-relative-speed-perception-for","title":"RSPNet: Relative Speed Perception for Unsupervised Video Representation Learning","date":"2020-10-27","arxiv_id":"2011.07949","repositories_listed":1,"syntology":null},{"url":"/paper/self-supervised-co-training-for-video","title":"Self-supervised Co-training for Video Representation Learning","date":"2020-10-19","arxiv_id":"2010.09709","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/self-supervised-multimodal-versatile-networks","title":"Self-Supervised MultiModal Versatile Networks","date":"2020-06-29","arxiv_id":"2006.16228","repositories_listed":1,"syntology":null},{"url":"/paper/video-playback-rate-perception-for-self","title":"Video Playback Rate Perception for Self-Supervised Spatio-Temporal Representation Learning","date":"2020-06-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/audio-visual-instance-discrimination-with","title":"Audio-Visual Instance Discrimination with Cross-Modal Agreement","date":"2020-04-27","arxiv_id":"2004.12943","repositories_listed":1,"syntology":null},{"url":"/paper/speednet-learning-the-speediness-in-videos","title":"SpeedNet: Learning the Speediness in Videos","date":"2020-04-13","arxiv_id":"2004.06130","repositories_listed":1,"syntology":null},{"url":"/paper/temporally-coherent-embeddings-for-self","title":"Temporally Coherent Embeddings for Self-Supervised Video Representation Learning","date":"2020-03-21","arxiv_id":"2004.02753","repositories_listed":1,"syntology":{"n":1,"n_ran":0,"n_unverified":1,"n_pointer_only":1}},{"url":"/paper/self-supervised-spatio-temporal-2","title":"Self-Supervised Visual Learning by Variable Playback Speeds Prediction of a Video","date":"2020-03-05","arxiv_id":"2003.02692","repositories_listed":1,"syntology":null}],"syntology_records":12,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}