{"url":"/sota/self-supervised-image-classification-on-1","task":{"name":"Self-Supervised Image Classification","url":"/task/self-supervised-image-classification","note":null},"dataset":{"name":"ImageNet (finetuned)","url":"/dataset/imagenet"},"category":null,"categories":["Adversarial","Audio","Computer Code","Computer Vision","Medical","Methodology","Miscellaneous","Music","Natural Language Processing","Reasoning","Speech"],"category_note":"the archive's category list for this table covers most areas; treated as no area assigned","description":"This is the task of image classification using representations learnt with self-supervised learning. Self-supervised methods generally involve a pretext task that is solved to learn a good representation and a loss function to learn with. One example of a loss function is an autoencoder based loss where the goal is reconstruction of an image pixel-by-pixel. A more popular recent example is a contrastive loss, which measure the similarity of sample pairs in a representation space, and where there can be a varying target instead of a fixed target to reconstruct (as in the case of autoencoders).\r\n\r\nA common evaluation protocol is to train a linear classifier on top of (frozen) representations learnt by self-supervised methods. The leaderboards for the linear evaluation protocol can be found below. In practice, it is more common to fine-tune features on a downstream task. An alternative evaluation protocol therefore uses semi-supervised learning and finetunes on a % of the labels. The leaderboards for the finetuning protocol can be accessed [here](https://paperswithcode.com/task/semi-supervised-image-classification).\r\n\r\nYou may want to read some blog posts before reading the papers and checking the leaderboards:\r\n\r\n- [Contrastive Self-Supervised Learning](https://ankeshanand.com/blog/2020/01/26/contrative-self-supervised-learning.html) - Ankesh Anand\r\n- [The Illustrated Self-Supervised Learning](https://amitness.com/2020/02/illustrated-self-supervised-learning/) - Amit Chaudhary\r\n- [Self-supervised learning and computer vision](https://www.fast.ai/2020/01/13/self_supervised/) - Jeremy Howard\r\n- [Self-Supervised Representation Learning](https://lilianweng.github.io/lil-log/2019/11/10/self-supervised-learning.html) - Lilian Weng\r\n\r\nThere is also Yann LeCun's talk at AAAI-20 which you can watch [here](https://vimeo.com/390347111) (35:00+).\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [A Simple Framework for Contrastive Learning of Visual Representations](https://arxiv.org/pdf/2002.05709v1.pdf) )</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top 1 Accuracy","Number of Params"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top 1 Accuracy":"higher","Number of Params":"lower"}},"counts":{"rows":65,"rows_with_code":64,"rows_with_paper_page":65,"rows_dated":65,"rows_using_additional_data":15},"rows":[{"rank_in_archive_order":1,"model":"DINOv2 (ViT-g/14, 448)","metrics":{"Number of Params":"1100M","Top 1 Accuracy":"88.9%"},"uses_additional_data":true,"paper_date":"2023-04-14","paper":"/paper/dinov2-learning-robust-visual-features","paper_url":"https://arxiv.org/abs/2304.07193v2","paper_title":"DINOv2: Learning Robust Visual Features without Supervision","code":"https://github.com/huggingface/transformers","n_code_links":26,"syntology":{"n_ran":21,"n_unverified":25,"n_samples":46,"n_pointer_only_licence":12}},{"rank_in_archive_order":2,"model":"PercMAE (ViT-L, dVAE)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"88.6%"},"uses_additional_data":true,"paper_date":"2022-12-30","paper":"/paper/improving-visual-representation-learning","paper_url":"https://arxiv.org/abs/2212.14504v2","paper_title":"Improving Visual Representation Learning through Perceptual Understanding","code":"https://github.com/tractableai/perceptual-mae","n_code_links":1,"syntology":null},{"rank_in_archive_order":3,"model":"DINOv2 (ViT-g/14)","metrics":{"Number of Params":"1100M","Top 1 Accuracy":"88.5%"},"uses_additional_data":true,"paper_date":"2023-04-14","paper":"/paper/dinov2-learning-robust-visual-features","paper_url":"https://arxiv.org/abs/2304.07193v2","paper_title":"DINOv2: Learning Robust Visual Features without Supervision","code":"https://github.com/huggingface/transformers","n_code_links":26,"syntology":{"n_ran":21,"n_unverified":25,"n_samples":46,"n_pointer_only_licence":12}},{"rank_in_archive_order":4,"model":"PeCo(ViT-H/14, 448)","metrics":{"Number of Params":"632M","Top 1 Accuracy":"88.3%"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/peco-perceptual-codebook-for-bert-pre","paper_url":"https://arxiv.org/abs/2111.12710v3","paper_title":"PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers","code":"https://github.com/xyzforever/bevt","n_code_links":1,"syntology":null},{"rank_in_archive_order":5,"model":"PercMAE (ViT-L)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"88.1%"},"uses_additional_data":false,"paper_date":"2022-12-30","paper":"/paper/improving-visual-representation-learning","paper_url":"https://arxiv.org/abs/2212.14504v2","paper_title":"Improving Visual Representation Learning through Perceptual Understanding","code":"https://github.com/tractableai/perceptual-mae","n_code_links":1,"syntology":null},{"rank_in_archive_order":6,"model":"dBOT (ViT-H/14)","metrics":{"Number of Params":"632M","Top 1 Accuracy":"88.0%"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"MAE (ViT-H/14, 448)","metrics":{"Number of Params":"632M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":8,"model":"iBOT(ViT-L/16, 512)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"87.8%"},"uses_additional_data":true,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"MAE + AugSub finetune (ViT-H/14)","metrics":{"Number of Params":"632M","Top 1 Accuracy":"87.2%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"SimMIM (SwinV2-H, 512)","metrics":{"Number of Params":"658M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/simmim-a-simple-framework-for-masked-image","paper_url":"https://arxiv.org/abs/2111.09886v2","paper_title":"SimMIM: A Simple Framework for Masked Image Modeling","code":"https://github.com/lightly-ai/lightly","n_code_links":7,"syntology":{"n_ran":9,"n_unverified":5,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"MAE (ViT-H/14)","metrics":{"Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":12,"model":"iBOT(ViT-L/16)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"86.6%"},"uses_additional_data":true,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"TEC_MAE (ViT-L/16, 224)","metrics":{"Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2022-10-20","paper":"/paper/towards-sustainable-self-supervised-learning","paper_url":"https://arxiv.org/abs/2210.11016v1","paper_title":"Towards Sustainable Self-supervised Learning","code":"https://github.com/sail-sg/tec","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":2,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":14,"model":"BEiT-L (ViT)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"86.3%"},"uses_additional_data":true,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":15,"model":"CAE (ViT-L/16)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/context-autoencoder-for-self-supervised","paper_url":"https://arxiv.org/abs/2202.03026v3","paper_title":"Context Autoencoder for Self-Supervised Representation Learning","code":"https://github.com/open-mmlab/mmselfsup","n_code_links":6,"syntology":null},{"rank_in_archive_order":16,"model":"MIRL (ViT-B-48)","metrics":{"Number of Params":"341M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2023-09-25","paper":"/paper/masked-image-residual-learning-for-scaling-1","paper_url":"https://arxiv.org/abs/2309.14136v3","paper_title":"Masked Image Residual Learning for Scaling Deeper Vision Transformers","code":"https://github.com/russellllaputa/MIRL","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"MAE + AugSub finetune (ViT-L/16)","metrics":{"Number of Params":"304M","Top 1 Accuracy":"86.1%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"SparK (ConvNeXt-Large, 384)","metrics":{"Number of Params":"198M","Top 1 Accuracy":"86.0%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":19,"model":"BootMAE(ViT-L)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"85.9%"},"uses_additional_data":false,"paper_date":"2022-07-14","paper":"/paper/bootstrapped-masked-autoencoders-for-vision","paper_url":"https://arxiv.org/abs/2207.07116v1","paper_title":"Bootstrapped Masked Autoencoders for Vision BERT Pretraining","code":"https://github.com/lightdxy/bootmae","n_code_links":1,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":7}},{"rank_in_archive_order":20,"model":"SEER (Regnet10B)","metrics":{"Number of Params":"10000M","Top 1 Accuracy":"85.8%"},"uses_additional_data":true,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"MaskFeat (ViT-L)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2021-12-16","paper":"/paper/masked-feature-prediction-for-self-supervised","paper_url":"https://arxiv.org/abs/2112.09133v2","paper_title":"Masked Feature Prediction for Self-Supervised Visual Pre-Training","code":"https://github.com/facebookresearch/SlowFast","n_code_links":6,"syntology":null},{"rank_in_archive_order":22,"model":"OFA (Large)","metrics":{"Number of Params":"473M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/unifying-architectures-tasks-and-modalities","paper_url":"https://arxiv.org/abs/2202.03052v2","paper_title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","code":"https://github.com/modelscope/modelscope","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"SparK (ConvNeXt-Large)","metrics":{"Number of Params":"198M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"SimMIM (Swin-L)","metrics":{"Number of Params":"197M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/simmim-a-simple-framework-for-masked-image","paper_url":"https://arxiv.org/abs/2111.09886v2","paper_title":"SimMIM: A Simple Framework for Masked Image Modeling","code":"https://github.com/lightly-ai/lightly","n_code_links":7,"syntology":{"n_ran":9,"n_unverified":5,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"Mugs (ViT-L/16)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2022-03-27","paper":"/paper/mugs-a-multi-granular-self-supervised","paper_url":"https://arxiv.org/abs/2203.14415v1","paper_title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","code":"https://github.com/sail-sg/mugs","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":17,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"iBOT (ViT-L/16)","metrics":{"Number of Params":"307M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"MIRL (ViT-S-54)","metrics":{"Number of Params":"96M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2023-09-25","paper":"/paper/masked-image-residual-learning-for-scaling-1","paper_url":"https://arxiv.org/abs/2309.14136v3","paper_title":"Masked Image Residual Learning for Scaling Deeper Vision Transformers","code":"https://github.com/russellllaputa/MIRL","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"ConvNeXt-Base (SparK pre-training)","metrics":{"Number of Params":"89M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"BEiT-B (ViT)","metrics":{"Number of Params":"86M","Top 1 Accuracy":"84.6%"},"uses_additional_data":true,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"A2MIM+ (ViT-B)","metrics":{"Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":31,"model":"iBOT (ViT-B/16)","metrics":{"Number of Params":"85M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"Mugs (ViT-B/16)","metrics":{"Number of Params":"85M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2022-03-27","paper":"/paper/mugs-a-multi-granular-self-supervised","paper_url":"https://arxiv.org/abs/2203.14415v1","paper_title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","code":"https://github.com/sail-sg/mugs","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":17,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"SEER (RegNetY-256GF)","metrics":{"Number of Params":"1.3B","Top 1 Accuracy":"84.2%"},"uses_additional_data":true,"paper_date":"2021-03-02","paper":"/paper/self-supervised-pretraining-of-visual","paper_url":"https://arxiv.org/abs/2103.01988v2","paper_title":"Self-supervised Pretraining of Visual Features in the Wild","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":34,"model":"A2MIM (ViT-B)","metrics":{"Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":35,"model":"MoCo v3 (ViT-L/16)","metrics":{"Number of Params":"304M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-04-05","paper":"/paper/an-empirical-study-of-training-self","paper_url":"https://arxiv.org/abs/2104.02057v4","paper_title":"An Empirical Study of Training Self-Supervised Vision Transformers","code":"https://github.com/open-mmlab/mmselfsup","n_code_links":9,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":36,"model":"mc-BEiT (ViT-B/16)","metrics":{"Number of Params":"86M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-03-29","paper":"/paper/mc-beit-multi-choice-discretization-for-image","paper_url":"https://arxiv.org/abs/2203.15371v4","paper_title":"mc-BEiT: Multi-choice Discretization for Image BERT Pre-training","code":"https://github.com/lixiaotong97/mc-beit","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":37,"model":"ConvNeXt-Small (SparK pre-training)","metrics":{"Number of Params":"50M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"SimMIM (Swin-B)","metrics":{"Number of Params":"88M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/simmim-a-simple-framework-for-masked-image","paper_url":"https://arxiv.org/abs/2111.09886v2","paper_title":"SimMIM: A Simple Framework for Masked Image Modeling","code":"https://github.com/lightly-ai/lightly","n_code_links":7,"syntology":{"n_ran":9,"n_unverified":5,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"iBOT (ViT-B/16)","metrics":{"Number of Params":"85M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2021-11-15","paper":"/paper/ibot-image-bert-pre-training-with-online","paper_url":"https://arxiv.org/abs/2111.07832v3","paper_title":"iBOT: Image BERT Pre-Training with Online Tokenizer","code":"https://github.com/bytedance/ibot","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":40,"model":"EsViT (Swin-B)","metrics":{"Number of Params":"87M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/efficient-self-supervised-vision-transformers","paper_url":"https://arxiv.org/abs/2106.09785v2","paper_title":"Efficient Self-supervised Vision Transformers for Representation Learning","code":"https://github.com/microsoft/esvit","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"MAE + AugSub finetune (ViT-B/16)","metrics":{"Number of Params":"87M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":42,"model":"SEER (RegNetY-128GF)","metrics":{"Number of Params":"693M","Top 1 Accuracy":"83.8%"},"uses_additional_data":true,"paper_date":"2021-03-02","paper":"/paper/self-supervised-pretraining-of-visual","paper_url":"https://arxiv.org/abs/2103.01988v2","paper_title":"Self-supervised Pretraining of Visual Features in the Wild","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"SimMIM (ViT-B/16)","metrics":{"Number of Params":"85M","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/simmim-a-simple-framework-for-masked-image","paper_url":"https://arxiv.org/abs/2111.09886v2","paper_title":"SimMIM: A Simple Framework for Masked Image Modeling","code":"https://github.com/lightly-ai/lightly","n_code_links":7,"syntology":{"n_ran":9,"n_unverified":5,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"MoCo v3 (ViT-B/16)","metrics":{"Number of Params":"86M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-04-05","paper":"/paper/an-empirical-study-of-training-self","paper_url":"https://arxiv.org/abs/2104.02057v4","paper_title":"An Empirical Study of Training Self-Supervised Vision Transformers","code":"https://github.com/open-mmlab/mmselfsup","n_code_links":9,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":45,"model":"DAMA (ViT-B/16)","metrics":{"Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2022-05-10","paper":"/paper/student-collaboration-improves-self","paper_url":"https://arxiv.org/abs/2205.05194v3","paper_title":"Multiplexed Immunofluorescence Brain Image Analysis Using Self-Supervised Dual-Loss Adaptive Masked Autoencoder","code":"https://github.com/hula-ai/DAMA","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"SimCLRv2 (ResNet-152, 3×+SK)","metrics":{"Number of Params":"795M","Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2020-06-17","paper":"/paper/big-self-supervised-models-are-strong-semi","paper_url":"https://arxiv.org/abs/2006.10029v2","paper_title":"Big Self-Supervised Models are Strong Semi-Supervised Learners","code":"https://github.com/google-research/simclr","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"ResNet-200 (SparK pre-training)","metrics":{"Number of Params":"65M","Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"DINO (ViT-B/16)","metrics":{"Number of Params":"85M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2021-04-29","paper":"/paper/emerging-properties-in-self-supervised-vision","paper_url":"https://arxiv.org/abs/2104.14294v2","paper_title":"Emerging Properties in Self-Supervised Vision Transformers","code":"https://github.com/facebookresearch/dino","n_code_links":32,"syntology":{"n_ran":5,"n_unverified":15,"n_samples":20,"n_pointer_only_licence":2}},{"rank_in_archive_order":49,"model":"ResNet-152 (SparK pre-training)","metrics":{"Number of Params":"60M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"Mugs (ViT-S/16)","metrics":{"Number of Params":"21M","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2022-03-27","paper":"/paper/mugs-a-multi-granular-self-supervised","paper_url":"https://arxiv.org/abs/2203.14415v1","paper_title":"Mugs: A Multi-Granular Self-Supervised Learning Framework","code":"https://github.com/sail-sg/mugs","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":17,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"A2MIM+ (ViT-S)","metrics":{"Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":52,"model":"ResNet-101 (SparK pre-training)","metrics":{"Number of Params":"44M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"A2MIM (ViT-S)","metrics":{"Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":54,"model":"SwAV (ResNeXt-101-32x16d)","metrics":{"Number of Params":"193M","Top 1 Accuracy":"82.0%"},"uses_additional_data":true,"paper_date":"2020-06-17","paper":"/paper/unsupervised-learning-of-visual-features-by","paper_url":"https://arxiv.org/abs/2006.09882v5","paper_title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments","code":"https://github.com/open-mmlab/mmdetection","n_code_links":18,"syntology":{"n_ran":13,"n_unverified":4,"n_samples":17,"n_pointer_only_licence":6}},{"rank_in_archive_order":55,"model":"ResNet-50 (SparK pre-training)","metrics":{"Number of Params":"26M","Top 1 Accuracy":"80.6%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"A2MIM+ (ResNet-50 RSB-A2)","metrics":{"Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":57,"model":"A2MIM (ResNet-50 RSB-A2)","metrics":{"Top 1 Accuracy":"80.4%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":58,"model":"A2MIM+ (ResNet-50 RSB-A3)","metrics":{"Top 1 Accuracy":"78.9%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":59,"model":"A2MIM (ResNet-50 RSB-A3)","metrics":{"Top 1 Accuracy":"78.8%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/architecture-agnostic-masked-image-modeling","paper_url":"https://arxiv.org/abs/2205.13943v4","paper_title":"Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN","code":"https://github.com/open-mmlab/mmpretrain","n_code_links":3,"syntology":null},{"rank_in_archive_order":60,"model":"DnC (Resnet-50)","metrics":{"Top 1 Accuracy":"78.2%"},"uses_additional_data":false,"paper_date":"2021-05-17","paper":"/paper/divide-and-contrast-self-supervised-learning","paper_url":"https://arxiv.org/abs/2105.08054v1","paper_title":"Divide and Contrast: Self-supervised Learning from Uncurated Data","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":61,"model":"SwAV (Resnet-50)","metrics":{"Number of Params":"182M","Top 1 Accuracy":"77.8%"},"uses_additional_data":true,"paper_date":"2020-06-17","paper":"/paper/unsupervised-learning-of-visual-features-by","paper_url":"https://arxiv.org/abs/2006.09882v5","paper_title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments","code":"https://github.com/open-mmlab/mmdetection","n_code_links":18,"syntology":{"n_ran":13,"n_unverified":4,"n_samples":17,"n_pointer_only_licence":6}},{"rank_in_archive_order":62,"model":"MoCo (Resnet-50)","metrics":{"Top 1 Accuracy":"77.3%"},"uses_additional_data":true,"paper_date":"2019-11-13","paper":"/paper/momentum-contrast-for-unsupervised-visual","paper_url":"https://arxiv.org/abs/1911.05722v3","paper_title":"Momentum Contrast for Unsupervised Visual Representation Learning","code":"https://github.com/open-mmlab/mmdetection","n_code_links":44,"syntology":{"n_ran":26,"n_unverified":16,"n_samples":42,"n_pointer_only_licence":16}},{"rank_in_archive_order":63,"model":"SimCLR (Resnet-50)","metrics":{"Top 1 Accuracy":"77.2%"},"uses_additional_data":true,"paper_date":"2020-02-13","paper":"/paper/a-simple-framework-for-contrastive-learning","paper_url":"https://arxiv.org/abs/2002.05709v3","paper_title":"A Simple Framework for Contrastive Learning of Visual Representations","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/projects/simclr","n_code_links":96,"syntology":{"n_ran":79,"n_unverified":58,"n_samples":137,"n_pointer_only_licence":52}},{"rank_in_archive_order":64,"model":"MoCo (Resnet-50)","metrics":{"Top 1 Accuracy":"77.0%"},"uses_additional_data":false,"paper_date":"2019-11-13","paper":"/paper/momentum-contrast-for-unsupervised-visual","paper_url":"https://arxiv.org/abs/1911.05722v3","paper_title":"Momentum Contrast for Unsupervised Visual Representation Learning","code":"https://github.com/open-mmlab/mmdetection","n_code_links":44,"syntology":{"n_ran":26,"n_unverified":16,"n_samples":42,"n_pointer_only_licence":16}},{"rank_in_archive_order":65,"model":"DeeperCluster (VGG16)","metrics":{"Number of Params":"138M","Top 1 Accuracy":"74.9%"},"uses_additional_data":true,"paper_date":"2019-05-03","paper":"/paper/leveraging-large-scale-uncurated-data-for","paper_url":"https://arxiv.org/abs/1905.01278v3","paper_title":"Unsupervised Pre-Training of Image Features on Non-Curated Data","code":"https://github.com/facebookresearch/deepcluster","n_code_links":2,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":41,"rows_with_any_sample_ran":35,"distinct_papers_with_graph_line":19,"distinct_papers_with_any_sample_ran":17,"samples_over_distinct_papers":{"n_ran":264,"n_unverified":244,"n_samples":508,"n_pointer_only_licence":183,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":473,"n_unverified":476,"n_samples":949,"n_pointer_only_licence":292,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}