{"url":"/sota/image-classification-on-objectnet","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"ObjectNet","url":"/dataset/objectnet"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top-1 Accuracy":"higher","Top-5 Accuracy":"higher"}},"counts":{"rows":106,"rows_with_code":83,"rows_with_paper_page":106,"rows_dated":106,"rows_using_additional_data":104},"rows":[{"rank_in_archive_order":1,"model":"CoCa","metrics":{"Top-1 Accuracy":"82.7"},"uses_additional_data":true,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"LiT","metrics":{"Top-1 Accuracy":"82.5"},"uses_additional_data":true,"paper_date":"2021-11-15","paper":"/paper/lit-zero-shot-transfer-with-locked-image-text","paper_url":"https://arxiv.org/abs/2111.07991v3","paper_title":"LiT: Zero-Shot Transfer with Locked-image text Tuning","code":"https://github.com/mlfoundations/open_clip","n_code_links":5,"syntology":null},{"rank_in_archive_order":3,"model":"BASIC","metrics":{"Top-1 Accuracy":"82.3"},"uses_additional_data":true,"paper_date":"2021-11-19","paper":"/paper/combined-scaling-for-zero-shot-transfer","paper_url":"https://arxiv.org/abs/2111.10050v3","paper_title":"Combined Scaling for Zero-shot Transfer Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":4,"model":"EVA-02-CLIP-E/14+","metrics":{"Top-1 Accuracy":"79.6"},"uses_additional_data":true,"paper_date":"2023-03-27","paper":"/paper/eva-clip-improved-training-techniques-for","paper_url":"https://arxiv.org/abs/2303.15389v1","paper_title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","code":"https://github.com/baaivision/eva","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"Baseline (ViT-G/14)","metrics":{"Top-1 Accuracy":"79.03"},"uses_additional_data":true,"paper_date":"2022-03-10","paper":"/paper/model-soups-averaging-weights-of-multiple","paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","code":"https://github.com/mlfoundations/model-soups","n_code_links":6,"syntology":{"n_ran":5,"n_unverified":12,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"Model soups (ViT-G/14)","metrics":{"Top-1 Accuracy":"78.52"},"uses_additional_data":true,"paper_date":"2022-03-10","paper":"/paper/model-soups-averaging-weights-of-multiple","paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","code":"https://github.com/mlfoundations/model-soups","n_code_links":6,"syntology":{"n_ran":5,"n_unverified":12,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"MAWS (ViT-6.5B)","metrics":{"Top-1 Accuracy":"77.9"},"uses_additional_data":true,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"MAWS (ViT-2B)","metrics":{"Top-1 Accuracy":"75.8"},"uses_additional_data":true,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"MAWS (ViT-H)","metrics":{"Top-1 Accuracy":"72.6"},"uses_additional_data":true,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":10,"model":"CLIP","metrics":{"Top-1 Accuracy":"72.3"},"uses_additional_data":true,"paper_date":"2021-02-26","paper":"/paper/learning-transferable-visual-models-from","paper_url":"https://arxiv.org/abs/2103.00020v1","paper_title":"Learning Transferable Visual Models From Natural Language Supervision","code":"https://github.com/openai/CLIP","n_code_links":82,"syntology":{"n_ran":16,"n_unverified":4,"n_samples":20,"n_pointer_only_licence":16}},{"rank_in_archive_order":11,"model":"ALIGN","metrics":{"Top-1 Accuracy":"72.2"},"uses_additional_data":true,"paper_date":"2021-11-19","paper":"/paper/combined-scaling-for-zero-shot-transfer","paper_url":"https://arxiv.org/abs/2111.10050v3","paper_title":"Combined Scaling for Zero-shot Transfer Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":12,"model":"WiSE-FT","metrics":{"Top-1 Accuracy":"72.1"},"uses_additional_data":true,"paper_date":"2021-09-04","paper":"/paper/robust-fine-tuning-of-zero-shot-models","paper_url":"https://arxiv.org/abs/2109.01903v3","paper_title":"Robust fine-tuning of zero-shot models","code":"https://github.com/mlfoundations/wise-ft","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":13,"model":"ViT-e","metrics":{"Top-1 Accuracy":"72.0"},"uses_additional_data":false,"paper_date":"2022-09-14","paper":"/paper/pali-a-jointly-scaled-multilingual-language","paper_url":"https://arxiv.org/abs/2209.06794v4","paper_title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"ViT-G/14","metrics":{"Top-1 Accuracy":"70.53"},"uses_additional_data":true,"paper_date":"2021-06-08","paper":"/paper/scaling-vision-transformers","paper_url":"https://arxiv.org/abs/2106.04560v2","paper_title":"Scaling Vision Transformers","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"SWAG (ViT H/14)","metrics":{"Top-1 Accuracy":"69.5"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":16,"model":"NS (Eff.-L2)","metrics":{"Top-1 Accuracy":"68.5"},"uses_additional_data":true,"paper_date":"2021-06-08","paper":"/paper/scaling-vision-transformers","paper_url":"https://arxiv.org/abs/2106.04560v2","paper_title":"Scaling Vision Transformers","code":"https://github.com/google-research/big_vision","n_code_links":1,"syntology":null},{"rank_in_archive_order":17,"model":"RegNetY 128GF (Platt)","metrics":{"Top-1 Accuracy":"64.3"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":18,"model":"LLE (ViT-H/14, MAE, Edge Aug)","metrics":{"Top-1 Accuracy":"60.78"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/a-whac-a-mole-dilemma-shortcuts-come-in","paper_url":"https://arxiv.org/abs/2212.04825v2","paper_title":"A Whac-A-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies Others","code":"https://github.com/facebookresearch/Whac-A-Mole","n_code_links":1,"syntology":null},{"rank_in_archive_order":19,"model":"SEER (RegNet10B)","metrics":{"Top-1 Accuracy":"60.2"},"uses_additional_data":true,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"ViT H/14 (Platt)","metrics":{"Top-1 Accuracy":"60"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":21,"model":"BiT-L (ResNet-152x4)","metrics":{"Top-1 Accuracy":"58.7","Top-5 Accuracy":"80"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":22,"model":"ViT L/16 (Platt)","metrics":{"Top-1 Accuracy":"57.3"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":23,"model":"Vit B/16 (Bamboo)","metrics":{"Top-1 Accuracy":"53.9"},"uses_additional_data":true,"paper_date":"2022-03-15","paper":"/paper/bamboo-building-mega-scale-vision-dataset","paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","code":"https://github.com/zhangyuanhan-ai/bamboo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":24,"model":"AR-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"52.0","Top-5 Accuracy":"73.5"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"ALIGN-MRL","metrics":{"Top-1 Accuracy":"51.6"},"uses_additional_data":true,"paper_date":"2022-05-26","paper":"/paper/matryoshka-representations-for-adaptive","paper_url":"https://arxiv.org/abs/2205.13147v4","paper_title":"Matryoshka Representation Learning","code":"https://github.com/novasearch-team/rag-retrieval","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"ViT-B/16 (ANN-1.3B)","metrics":{"Top-1 Accuracy":"50.7"},"uses_additional_data":true,"paper_date":"2021-08-12","paper":"/paper/billion-scale-pretraining-with-vision","paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":27,"model":"ViT-B/16 (512x512) + Pyramid","metrics":{"Top-1 Accuracy":"49.39"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"ResNet-101 (JFT-300M)","metrics":{"Top-1 Accuracy":"49.1"},"uses_additional_data":true,"paper_date":"2021-08-12","paper":"/paper/billion-scale-pretraining-with-vision","paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":29,"model":"ViT B/16","metrics":{"Top-1 Accuracy":"48.9"},"uses_additional_data":true,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":30,"model":"ViT-B/32","metrics":{"Top-1 Accuracy":"48.4"},"uses_additional_data":true,"paper_date":"2021-08-12","paper":"/paper/billion-scale-pretraining-with-vision","paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":31,"model":"ViT-B/16 (512x512) + Pixel","metrics":{"Top-1 Accuracy":"47.53"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":32,"model":"AR-B (Opt Relevance)","metrics":{"Top-1 Accuracy":"47.1","Top-5 Accuracy":"70"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"BiT-M (ResNet-152x4)","metrics":{"Top-1 Accuracy":"47.0","Top-5 Accuracy":"69"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":34,"model":"ViT-B/16 (512x512)","metrics":{"Top-1 Accuracy":"46.68"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"ViT-B (Discrete 512x512)","metrics":{"Top-1 Accuracy":"46.62"},"uses_additional_data":true,"paper_date":"2021-11-20","paper":"/paper/discrete-representations-strengthen-vision-1","paper_url":"https://arxiv.org/abs/2111.10493v2","paper_title":"Discrete Representations Strengthen Vision Transformer Robustness","code":"https://github.com/alibaba/easyrobust/tree/main/examples/imageclassification/imagenet/drvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":36,"model":"AR-L","metrics":{"Top-1 Accuracy":"46.5","Top-5 Accuracy":"68.3"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"ViT-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"43.2","Top-5 Accuracy":"65.8"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"CLIP L","metrics":{"Top-1 Accuracy":"42.80"},"uses_additional_data":true,"paper_date":"2021-12-31","paper":"/paper/optimal-representations-for-covariate-shift-1","paper_url":"https://arxiv.org/abs/2201.00057v2","paper_title":"Optimal Representations for Covariate Shift","code":"https://github.com/facebookresearch/DomainBed","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"ResNet-50 (JFT-300M)","metrics":{"Top-1 Accuracy":"42.5"},"uses_additional_data":true,"paper_date":"2021-08-12","paper":"/paper/billion-scale-pretraining-with-vision","paper_url":"https://arxiv.org/abs/2108.05887v1","paper_title":"Billion-Scale Pretraining with Vision Transformers for Multi-Task Visual Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":40,"model":"ViT-B (Opt Relevance)","metrics":{"Top-1 Accuracy":"42.2","Top-5 Accuracy":"65.1"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":41,"model":"CLIP L (LAION)","metrics":{"Top-1 Accuracy":"42.10"},"uses_additional_data":true,"paper_date":"2021-12-31","paper":"/paper/optimal-representations-for-covariate-shift-1","paper_url":"https://arxiv.org/abs/2201.00057v2","paper_title":"Optimal Representations for Covariate Shift","code":"https://github.com/facebookresearch/DomainBed","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"AR-B","metrics":{"Top-1 Accuracy":"41.4","Top-5 Accuracy":"63.7"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"RegViT on 384x384 + Adv Pyramid","metrics":{"Top-1 Accuracy":"39.79"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":44,"model":"ResNet-152 + GenInt with Transfer","metrics":{"Top-1 Accuracy":"39.38","Top-5 Accuracy":"61.43"},"uses_additional_data":true,"paper_date":"2020-12-22","paper":"/paper/generative-interventions-for-causal-learning","paper_url":"https://arxiv.org/abs/2012.12265v2","paper_title":"Generative Interventions for Causal Learning","code":"https://github.com/cvlab-columbia/GenInt","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"AR-S (Opt Relevance)","metrics":{"Top-1 Accuracy":"39.3","Top-5 Accuracy":"61.7"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"ResNet-50 (Bamboo)","metrics":{"Top-1 Accuracy":"38.8"},"uses_additional_data":true,"paper_date":"2022-03-15","paper":"/paper/bamboo-building-mega-scale-vision-dataset","paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","code":"https://github.com/zhangyuanhan-ai/bamboo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":47,"model":"RegViT on 384x384 + Adv Pixel","metrics":{"Top-1 Accuracy":"37.41"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":48,"model":"ViT-L","metrics":{"Top-1 Accuracy":"37.4","Top-5 Accuracy":"59.5"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"DeiT-L (Opt Relevance)","metrics":{"Top-1 Accuracy":"36.3","Top-5 Accuracy":"56.6"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":50,"model":"BiT-S (ResNet-152x4)","metrics":{"Top-1 Accuracy":"36.0","Top-5 Accuracy":"57"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"NASNet-A","metrics":{"Top-1 Accuracy":"35.77","Top-5 Accuracy":"56.05"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":52,"model":"PNASNet-5L","metrics":{"Top-1 Accuracy":"35.63","Top-5 Accuracy":"54.95"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":53,"model":"RegViT on 384x384","metrics":{"Top-1 Accuracy":"35.59"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":54,"model":"ViT-B","metrics":{"Top-1 Accuracy":"35.1","Top-5 Accuracy":"56.4"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"RegViT on 384x384 + Random Pyramid","metrics":{"Top-1 Accuracy":"34.83"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"AR-S","metrics":{"Top-1 Accuracy":"34.3","Top-5 Accuracy":"55.8"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":57,"model":"RegViT on 384x384 + Random Pixel","metrics":{"Top-1 Accuracy":"34.12"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":58,"model":"RegViT (RandAug) + Adv Pyramid","metrics":{"Top-1 Accuracy":"32.92"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":59,"model":"Inception-v4","metrics":{"Top-1 Accuracy":"32.24","Top-5 Accuracy":"51.98"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":60,"model":"DeiT-S (Opt Relevance)","metrics":{"Top-1 Accuracy":"31.6","Top-5 Accuracy":"53"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":61,"model":"ResNet-50 + CGC","metrics":{"Top-1 Accuracy":"31.53","Top-5 Accuracy":"50.16"},"uses_additional_data":true,"paper_date":"2019-10-12","paper":"/paper/context-gated-convolution","paper_url":"https://arxiv.org/abs/1910.05577v4","paper_title":"Context-Gated Convolution","code":"https://github.com/XudongLinthu/context-gated-convolution","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"DeiT-L","metrics":{"Top-1 Accuracy":"31.4","Top-5 Accuracy":"48.5"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":63,"model":"Discrete ViT + Pixel","metrics":{"Top-1 Accuracy":"30.98"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":64,"model":"Discrete ViT + Pyramid","metrics":{"Top-1 Accuracy":"30.28"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"RegViT (RandAug) + Adv Pixel","metrics":{"Top-1 Accuracy":"30.11"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":66,"model":"Discrete ViT","metrics":{"Top-1 Accuracy":"29.95"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":67,"model":"ResNet-152","metrics":{"Top-1 Accuracy":"29.59","Top-5 Accuracy":"49.4"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":68,"model":"RegViT (RandAug) + Random Pyramid","metrics":{"Top-1 Accuracy":"29.41"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":69,"model":"RegViT (RandAug)","metrics":{"Top-1 Accuracy":"29.3"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"ResNet-50 + GroupNorm","metrics":{"Top-1 Accuracy":"29.2","Top-5 Accuracy":"50.2"},"uses_additional_data":true,"paper_date":"2020-06-30","paper":"/paper/improving-robustness-against-common","paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","code":"https://github.com/bethgelab/robustness","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":71,"model":"ResNet-50 + RoHL","metrics":{"Top-1 Accuracy":"29.2"},"uses_additional_data":true,"paper_date":"2020-06-30","paper":"/paper/improving-robustness-against-common","paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","code":"https://github.com/bethgelab/robustness","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"RegViT (RandAug) + Random Pixel","metrics":{"Top-1 Accuracy":"28.72"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":73,"model":"MLP-Mixer + Pyramid","metrics":{"Top-1 Accuracy":"28.6"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"ResNet-50 + FixUp","metrics":{"Top-1 Accuracy":"28.5","Top-5 Accuracy":"48.6"},"uses_additional_data":true,"paper_date":"2020-06-30","paper":"/paper/improving-robustness-against-common","paper_url":"https://arxiv.org/abs/2006.16971v2","paper_title":"Improving robustness against common corruptions by covariate shift adaptation","code":"https://github.com/bethgelab/robustness","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"ResNet-50 + MixUp (rescaled)","metrics":{"Top-1 Accuracy":"28.37"},"uses_additional_data":true,"paper_date":"2020-06-10","paper":"/paper/on-mixup-regularization","paper_url":"https://arxiv.org/abs/2006.06049v3","paper_title":"On Mixup Regularization","code":"https://github.com/google/uncertainty-baselines/tree/master/baselines/imagenet","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"DeiT-S","metrics":{"Top-1 Accuracy":"28.3","Top-5 Accuracy":"47.3"},"uses_additional_data":true,"paper_date":"2022-06-02","paper":"/paper/optimizing-relevance-maps-of-vision","paper_url":"https://arxiv.org/abs/2206.01161v1","paper_title":"Optimizing Relevance Maps of Vision Transformers Improves Robustness","code":"https://github.com/hila-chefer/robustvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"ResNet-18 + GenInt with Transfer","metrics":{"Top-1 Accuracy":"27.03","Top-5 Accuracy":"48.02"},"uses_additional_data":true,"paper_date":"2020-12-22","paper":"/paper/generative-interventions-for-causal-learning","paper_url":"https://arxiv.org/abs/2012.12265v2","paper_title":"Generative Interventions for Causal Learning","code":"https://github.com/cvlab-columbia/GenInt","n_code_links":1,"syntology":null},{"rank_in_archive_order":78,"model":"MLP-Mixer","metrics":{"Top-1 Accuracy":"25.9"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":79,"model":"RELICv2","metrics":{"Top-1 Accuracy":"25.9"},"uses_additional_data":true,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"ViT + MixUp","metrics":{"Top-1 Accuracy":"25.65"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"C-BYOL","metrics":{"Top-1 Accuracy":"25.5"},"uses_additional_data":true,"paper_date":"2021-09-27","paper":"/paper/compressive-visual-representations","paper_url":"https://arxiv.org/abs/2109.12909v3","paper_title":"Compressive Visual Representations","code":"https://github.com/google-research/compressive-visual-representations","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":82,"model":"MLP-Mixer + Pixel","metrics":{"Top-1 Accuracy":"24.75"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":83,"model":"BYOL (BG_RM)","metrics":{"Top-1 Accuracy":"23.9"},"uses_additional_data":true,"paper_date":"2021-03-23","paper":"/paper/leveraging-background-augmentations-to","paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":84,"model":"RELIC","metrics":{"Top-1 Accuracy":"23.8"},"uses_additional_data":true,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":85,"model":"BYOL","metrics":{"Top-1 Accuracy":"23"},"uses_additional_data":true,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"SwAV (BG_RM)","metrics":{"Top-1 Accuracy":"21.9"},"uses_additional_data":true,"paper_date":"2021-03-23","paper":"/paper/leveraging-background-augmentations-to","paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":87,"model":"ViT + CutMix","metrics":{"Top-1 Accuracy":"21.61"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":88,"model":"MoCo-v2 (BG_Swaps)","metrics":{"Top-1 Accuracy":"20.8"},"uses_additional_data":true,"paper_date":"2021-03-23","paper":"/paper/leveraging-background-augmentations-to","paper_url":"https://arxiv.org/abs/2103.12719v2","paper_title":"Characterizing and Improving the Robustness of Self-Supervised Learning through Background Augmentations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"C-SimCLR","metrics":{"Top-1 Accuracy":"20.8"},"uses_additional_data":true,"paper_date":"2021-09-27","paper":"/paper/compressive-visual-representations","paper_url":"https://arxiv.org/abs/2109.12909v3","paper_title":"Compressive Visual Representations","code":"https://github.com/google-research/compressive-visual-representations","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":90,"model":"SeLa(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"20.61","Top-5 Accuracy":"48.83"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":91,"model":"DILEMMA","metrics":{"Top-1 Accuracy":"20.51"},"uses_additional_data":true,"paper_date":"2022-04-10","paper":"/paper/dilemma-self-supervised-shape-and-texture","paper_url":"https://arxiv.org/abs/2204.04788v2","paper_title":"Representation Learning by Detecting Incorrect Location Embeddings","code":"https://github.com/separius/dilemma","n_code_links":1,"syntology":null},{"rank_in_archive_order":92,"model":"DeepCluster(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"19.73","Top-5 Accuracy":"46.81"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":93,"model":"VGG-14","metrics":{"Top-1 Accuracy":"19.13","Top-5 Accuracy":"37.15"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":94,"model":"ResNet-50 (ImageNet-Captions)","metrics":{"Top-1 Accuracy":"18.70"},"uses_additional_data":true,"paper_date":"2022-05-03","paper":"/paper/data-determines-distributional-robustness-in","paper_url":"https://arxiv.org/abs/2205.01397v2","paper_title":"Data Determines Distributional Robustness in Contrastive Language Image Pre-training (CLIP)","code":"https://github.com/mlfoundations/imagenet-captions","n_code_links":2,"syntology":null},{"rank_in_archive_order":95,"model":"SwAV (reverse linear probing)","metrics":{"Top-1 Accuracy":"17.71","Top-5 Accuracy":"43.64"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":96,"model":"ViT","metrics":{"Top-1 Accuracy":"17.36"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/pyramid-adversarial-training-improves-vit","paper_url":"https://arxiv.org/abs/2111.15121v2","paper_title":"Pyramid Adversarial Training Improves ViT Performance","code":"https://github.com/google-research/scenic/tree/main/scenic/projects/adversarialtraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"ResNet34-RPG","metrics":{"Top-1 Accuracy":"16.5"},"uses_additional_data":true,"paper_date":"2021-07-15","paper":"/paper/recurrent-parameter-generators","paper_url":"https://arxiv.org/abs/2107.07110v3","paper_title":"Compact and Optimal Deep Learning with Recurrent Parameter Generators","code":"https://github.com/samaonline/Recurrent-Parameter-Generators","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":98,"model":"CLIP (CC12M pretrain)","metrics":{"Top-1 Accuracy":"15.24"},"uses_additional_data":true,"paper_date":"2022-04-10","paper":"/paper/robust-cross-modal-representation-learning","paper_url":"https://arxiv.org/abs/2204.04588v1","paper_title":"Robust Cross-Modal Representation Learning with Progressive Self-Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":99,"model":"SimCLR","metrics":{"Top-1 Accuracy":"14.6"},"uses_additional_data":true,"paper_date":"2022-01-13","paper":"/paper/pushing-the-limits-of-self-supervised-resnets","paper_url":"https://arxiv.org/abs/2201.05119v2","paper_title":"Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?","code":"https://github.com/google-deepmind/relicv2","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":14,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":100,"model":"ResNet-152 (FRCNN-ag-ad, VOC)","metrics":{"Top-1 Accuracy":"13.2","Top-5 Accuracy":"29.7"},"uses_additional_data":true,"paper_date":"2020-11-28","paper":"/paper/class-agnostic-object-detection","paper_url":"https://arxiv.org/abs/2011.14204v1","paper_title":"Class-agnostic Object Detection","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":101,"model":"MoCo(v2) (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.67","Top-5 Accuracy":"31.45"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":102,"model":"MoCHi  (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.64","Top-5 Accuracy":"31.71"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":103,"model":"OBoW (reverse linear probing)","metrics":{"Top-1 Accuracy":"12.23","Top-5 Accuracy":"31.72"},"uses_additional_data":true,"paper_date":"2021-09-29","paper":"/paper/measuring-the-interpretability-of","paper_url":"https://openreview.net/forum?id=HFPTzdwN39","paper_title":"Measuring the Interpretability of Unsupervised Representations via Quantized Reversed Probing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":104,"model":"AlexNet","metrics":{"Top-1 Accuracy":"6.78","Top-5 Accuracy":"17.6"},"uses_additional_data":true,"paper_date":"2019-12-01","paper":"/paper/objectnet-a-large-scale-bias-controlled","paper_url":"http://papers.nips.cc/paper/9142-objectnet-a-large-scale-bias-controlled-dataset-for-pushing-the-limits-of-object-recognition-models","paper_title":"ObjectNet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":105,"model":"BigBiGAN (RevNet-50 4×)","metrics":{"Top-1 Accuracy":"4.92"},"uses_additional_data":true,"paper_date":"2020-08-24","paper":"/paper/self-supervised-learning-for-large-scale","paper_url":"https://arxiv.org/abs/2008.10312v2","paper_title":"Self-Supervised Learning for Large-Scale Unsupervised Image Clustering","code":"https://github.com/Randl/kmeans_selfsuper","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":106,"model":"ViT-H/14","metrics":{"Top-5 Accuracy":"82.1"},"uses_additional_data":true,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":281,"n_unverified":138,"n_samples":419,"n_pointer_only_licence":154}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":27,"rows_with_any_sample_ran":20,"distinct_papers_with_graph_line":16,"distinct_papers_with_any_sample_ran":13,"samples_over_distinct_papers":{"n_ran":333,"n_unverified":216,"n_samples":549,"n_pointer_only_licence":174,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":357,"n_unverified":298,"n_samples":655,"n_pointer_only_licence":177,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}