{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/self-supervised-pretraining-of-visual","title":"Self-supervised Pretraining of Visual Features in the Wild","arxiv_id":"2103.01988","date":"2021-03-02","proceeding":null,"authors":["Priya Goyal","Mathilde Caron","Benjamin Lefaudeux","Min Xu","Pengchao Wang","Vivek Pai","Mannat Singh","Vitaliy Liptchinsky","Ishan Misra","Armand Joulin","Piotr Bojanowski"],"abstract":"Recently, self-supervised learning methods like MoCo, SimCLR, BYOL and SwAV have reduced the gap with supervised methods. These results have been achieved in a control environment, that is the highly curated ImageNet dataset. However, the premise of self-supervised learning is that it can learn from any random image and from any unbounded dataset. In this work, we explore if self-supervision lives to its expectation by training large models on random, uncurated images with no supervision. Our final SElf-supERvised (SEER) model, a RegNetY with 1.3B parameters trained on 1B random images with 512 GPUs achieves 84.2% top-1 accuracy, surpassing the best self-supervised pretrained model by 1% and confirming that self-supervised learning works in a real world setting. Interestingly, we also observe that self-supervised models are good few-shot learners achieving 77.9% top-1 with access to only 10% of ImageNet. Code: https://github.com/facebookresearch/vissl","url_abs":"https://arxiv.org/abs/2103.01988v2","url_pdf":"https://arxiv.org/pdf/2103.01988v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"self-supervised-pretraining-of-visual","repo_url":"https://github.com/facebookresearch/vissl","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"self-supervised-image-classification","task_name":"Self-Supervised Image Classification"},{"task_slug":"self-supervised-learning","task_name":"Self-Supervised Learning"},{"task_slug":"semi-supervised-image-classification","task_name":"Semi-Supervised Image Classification"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"byol","method_name":"BYOL"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"colorjitter","method_name":"ColorJitter"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"cosine-annealing","method_name":"Cosine Annealing"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"feedforward-network","method_name":"Feedforward Network"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"gradient-checkpointing","method_name":"Gradient Checkpointing"},{"method_slug":"grouped-convolution","method_name":"Grouped Convolution"},{"method_slug":"infonce","method_name":"InfoNCE"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"lars","method_name":"LARS"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"moco","method_name":"MoCo"},{"method_slug":"nt-xent","method_name":"NT-Xent"},{"method_slug":"random-gaussian-blur","method_name":"Random Gaussian Blur"},{"method_slug":"random-resized-crop","method_name":"Random Resized Crop"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"regnety","method_name":"RegNetY"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"seer","method_name":"SEER"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"simclr","method_name":"SimCLR"},{"method_slug":"squeeze-and-excitation-block","method_name":"Squeeze-and-Excitation Block"},{"method_slug":"swav","method_name":"SwAV"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-classification-on-places205","task":"Image Classification","dataset":"Places205","model":"SEER","rank_in_archive_order":6,"of":15,"metrics":{"Top 1 Accuracy":"66.0"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-places205","task":"Image Classification","dataset":"Places205","model":"RegNetY-128GF (Supervised)","rank_in_archive_order":9,"of":15,"metrics":{"Top 1 Accuracy":"62.7"},"uses_additional_data":false},{"leaderboard":"/sota/self-supervised-image-classification-on","task":"Self-Supervised Image Classification","dataset":"ImageNet","model":"SEER","rank_in_archive_order":52,"of":144,"metrics":{"Number of Params":"1300M","Top 1 Accuracy":"77.5%"},"uses_additional_data":true},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"SEER (RegNetY-256GF)","rank_in_archive_order":33,"of":65,"metrics":{"Number of Params":"1.3B","Top 1 Accuracy":"84.2%"},"uses_additional_data":true},{"leaderboard":"/sota/self-supervised-image-classification-on-1","task":"Self-Supervised Image Classification","dataset":"ImageNet (finetuned)","model":"SEER (RegNetY-128GF)","rank_in_archive_order":42,"of":65,"metrics":{"Number of Params":"693M","Top 1 Accuracy":"83.8%"},"uses_additional_data":true},{"leaderboard":"/sota/semi-supervised-image-classification-on-1","task":"Semi-Supervised Image Classification","dataset":"ImageNet - 1% labeled data","model":"SEER Large (RegNetY-256GF)","rank_in_archive_order":38,"of":65,"metrics":{"Top 1 Accuracy":"60.5%"},"uses_additional_data":false},{"leaderboard":"/sota/semi-supervised-image-classification-on-1","task":"Semi-Supervised Image Classification","dataset":"ImageNet - 1% labeled data","model":"SEER Small (RegNetY-128GF)","rank_in_archive_order":43,"of":65,"metrics":{"Top 1 Accuracy":"57.5%"},"uses_additional_data":false},{"leaderboard":"/sota/semi-supervised-image-classification-on-2","task":"Semi-Supervised Image Classification","dataset":"ImageNet - 10% labeled data","model":"SEER Large (RegNetY-256GF)","rank_in_archive_order":18,"of":75,"metrics":{"Top 1 Accuracy":"77.9%"},"uses_additional_data":false},{"leaderboard":"/sota/semi-supervised-image-classification-on-2","task":"Semi-Supervised Image Classification","dataset":"ImageNet - 10% labeled data","model":"SEER Small (RegNetY-128GF)","rank_in_archive_order":22,"of":75,"metrics":{"Top 1 Accuracy":"76.7%"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2103.01988","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}