{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/self-supervised-video-representation-learning-7","title":"Self-supervised Video Representation Learning with Cross-Stream Prototypical Contrasting","arxiv_id":"2106.10137","date":"2021-06-18","proceeding":null,"authors":["Martine Toering","Ioannis Gatopoulos","Maarten Stol","Vincent Tao Hu"],"abstract":"Instance-level contrastive learning techniques, which rely on data augmentation and a contrastive loss function, have found great success in the domain of visual representation learning. They are not suitable for exploiting the rich dynamical structure of video however, as operations are done on many augmented instances. In this paper we propose \"Video Cross-Stream Prototypical Contrasting\", a novel method which predicts consistent prototype assignments from both RGB and optical flow views, operating on sets of samples. Specifically, we alternate the optimization process; while optimizing one of the streams, all views are mapped to one set of stream prototype vectors. Each of the assignments is predicted with all views except the one matching the prediction, pushing representations closer to their assigned prototypes. As a result, more efficient video embeddings with ingrained motion information are learned, without the explicit need for optical flow computation during inference. We obtain state-of-the-art results on nearest-neighbour video retrieval and action recognition, outperforming previous best by +3.2% on UCF101 using the S3D backbone (90.5% Top-1 acc), and by +7.2% on UCF101 and +15.1% on HMDB51 using the R(2+1)D backbone.","url_abs":"https://arxiv.org/abs/2106.10137v3","url_pdf":"https://arxiv.org/pdf/2106.10137v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"self-supervised-video-representation-learning-7","repo_url":"https://github.com/martinetoering/ViCC","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"},{"task_slug":"action-recognition-in-videos-2","task_name":"Action Recognition In Videos"},{"task_slug":"contrastive-learning","task_name":"Contrastive Learning"},{"task_slug":"data-augmentation","task_name":"Data Augmentation"},{"task_slug":"optical-flow-estimation","task_name":"Optical Flow Estimation"},{"task_slug":"representation-learning","task_name":"Representation Learning"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"self-supervised-action-recognition","task_name":"Self-Supervised Action Recognition"},{"task_slug":"self-supervised-learning","task_name":"Self-Supervised Learning"},{"task_slug":"self-supervised-video-retrieval","task_name":"Self-supervised Video Retrieval"},{"task_slug":"video-classification","task_name":"Video Classification"},{"task_slug":"video-recognition","task_name":"Video Recognition"},{"task_slug":"video-retrieval","task_name":"Video Retrieval"}],"methods":[{"method_slug":"2-1-d-convolution","method_name":"(2+1)D Convolution"},{"method_slug":"3d-convolution","method_name":"3D Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"contrastive-learning","method_name":"Contrastive Learning"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"r-2-1-d","method_name":"R(2+1)D"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-connection","method_name":"Residual Connection"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"ViCC (S3D; R+F)","rank_in_archive_order":23,"of":48,"metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"62.2"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"ViCC (R2+1D; R+F)","rank_in_archive_order":24,"of":48,"metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"61.5"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"ViCC (R2+1D; RGB)","rank_in_archive_order":33,"of":48,"metrics":{"Frozen":"false","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"52.4"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51","task":"Self-Supervised Action Recognition","dataset":"HMDB51","model":"ViCC (S3D; RGB)","rank_in_archive_order":36,"of":48,"metrics":{"Frozen":"true","Pre-Training Dataset":"UCF101","Top-1 Accuracy":"38.5"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51-1","task":"Self-Supervised Action Recognition","dataset":"HMDB51 (finetuned)","model":"ViCC (S3D; R+F)","rank_in_archive_order":9,"of":14,"metrics":{"Pretraining Dataset":"UCF101","Top-1 Accuracy":"62.2"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51-1","task":"Self-Supervised Action Recognition","dataset":"HMDB51 (finetuned)","model":"ViCC (R2+1D; RGB)","rank_in_archive_order":13,"of":14,"metrics":{"Pretraining Dataset":"UCF101","Top-1 Accuracy":"52.4"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-hmdb51-1","task":"Self-Supervised Action Recognition","dataset":"HMDB51 (finetuned)","model":"ViCC (S3D; RGB))","rank_in_archive_order":14,"of":14,"metrics":{"Pretraining Dataset":"UCF101","Top-1 Accuracy":"47.9"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"ViCC (S3D; R+F)","rank_in_archive_order":22,"of":53,"metrics":{"3-fold Accuracy":"90.5","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"ViCC (S3D; RGB)","rank_in_archive_order":23,"of":53,"metrics":{"3-fold Accuracy":"88.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"ViCC (R2+1D; R+F)","rank_in_archive_order":24,"of":53,"metrics":{"3-fold Accuracy":"88.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"ViCC (R2+1D; RGB)","rank_in_archive_order":30,"of":53,"metrics":{"3-fold Accuracy":"82.8","Frozen":"false","Pre-Training Dataset":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101","task":"Self-Supervised Action Recognition","dataset":"UCF101","model":"ViCC (S3D; RGB)","rank_in_archive_order":36,"of":53,"metrics":{"3-fold Accuracy":"72.2","Frozen":"true","Pre-Training Dataset":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset":"UCF101 (finetuned)","model":"ViCC (S3D; R+F)","rank_in_archive_order":9,"of":14,"metrics":{"3-fold Accuracy":"90.5","Pretrain":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset":"UCF101 (finetuned)","model":"ViCC (R2+1D; R+F)","rank_in_archive_order":11,"of":14,"metrics":{"3-fold Accuracy":"88.8","Pretrain":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset":"UCF101 (finetuned)","model":"ViCC (S3D; RGB)","rank_in_archive_order":13,"of":14,"metrics":{"3-fold Accuracy":"84.3","Pretrain":"UCF101"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-action-recognition-on-ucf101-1","task":"Self-Supervised Action Recognition","dataset":"UCF101 (finetuned)","model":"ViCC (R2+1D; RGB)","rank_in_archive_order":14,"of":14,"metrics":{"3-fold Accuracy":"82.8","Pretrain":"UCF101"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/2106.10137","atlas_url":"https://app.syntology.ai/?focus=2106.10137","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}