{"url":"/sota/image-classification-on-flowers-102","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"Flowers-102","url":"/dataset/oxford-102-flower"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Accuracy","FLOPS","PARAMS","Per-Class Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Accuracy":"higher","FLOPS":"lower","PARAMS":"lower","Per-Class Accuracy":"higher"}},"counts":{"rows":52,"rows_with_code":50,"rows_with_paper_page":52,"rows_dated":52,"rows_using_additional_data":48},"rows":[{"rank_in_archive_order":1,"model":"CCT-14/7x2","metrics":{"Accuracy":"99.76"},"uses_additional_data":true,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":2,"model":"VIT-L/16 (Background)","metrics":{"Accuracy":"99.75"},"uses_additional_data":true,"paper_date":"2023-05-05","paper":"/paper/reduction-of-class-activation-uncertainty","paper_url":"https://arxiv.org/abs/2305.03238v6","paper_title":"Reduction of Class Activation Uncertainty with Background Information","code":"https://github.com/dipuk0506/SpinalNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":3,"model":"CvT-W24","metrics":{"Accuracy":"99.72"},"uses_additional_data":true,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":4,"model":"Bamboo (ViT-B/16)","metrics":{"Accuracy":"99.7"},"uses_additional_data":true,"paper_date":"2022-03-15","paper":"/paper/bamboo-building-mega-scale-vision-dataset","paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","code":"https://github.com/zhangyuanhan-ai/bamboo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":5,"model":"","metrics":{"Accuracy":"99.68"},"uses_additional_data":false,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":281,"n_unverified":138,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":6,"model":"EffNet-L2 (SAM)","metrics":{"Accuracy":"99.65%"},"uses_additional_data":true,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":7,"model":"ALIGN","metrics":{"Accuracy":"99.65%"},"uses_additional_data":true,"paper_date":"2021-02-11","paper":"/paper/scaling-up-visual-and-vision-language","paper_url":"https://arxiv.org/abs/2102.05918v2","paper_title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","code":"https://github.com/facebookresearch/metaclip","n_code_links":5,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":9}},{"rank_in_archive_order":8,"model":"BiT-L (ResNet)","metrics":{"Accuracy":"99.63"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"ConvMLP-S","metrics":{"Accuracy":"99.5"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ConvMLP-L","metrics":{"Accuracy":"99.5"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"ResNet-152x4-AGC (ImageNet-21K)","metrics":{"Accuracy":"99.49"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/effect-of-large-scale-pre-training-on-full","paper_url":"https://arxiv.org/abs/2106.00116v4","paper_title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","code":"https://github.com/SLAMPAI/large-scale-pretraining-transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"BiT-M (ResNet)","metrics":{"Accuracy":"99.30"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"Wide-ResNet-101 (Spinal FC)","metrics":{"Accuracy":"99.30"},"uses_additional_data":true,"paper_date":"2020-07-07","paper":"/paper/spinalnet-deep-neural-network-with-gradual-1","paper_url":"https://arxiv.org/abs/2007.03347v3","paper_title":"SpinalNet: Deep Neural Network with Gradual Input","code":"https://github.com/dipuk0506/SpinalNet","n_code_links":3,"syntology":null},{"rank_in_archive_order":14,"model":"TResNet-L","metrics":{"Accuracy":"99.1%"},"uses_additional_data":true,"paper_date":"2020-03-30","paper":"/paper/tresnet-high-performance-gpu-dedicated","paper_url":"https://arxiv.org/abs/2003.13630v3","paper_title":"TResNet: High Performance GPU-Dedicated Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":15,"model":"Grafit (RegNet-8GF)","metrics":{"Accuracy":"99.1%"},"uses_additional_data":true,"paper_date":"2020-11-25","paper":"/paper/grafit-learning-fine-grained-image","paper_url":"https://arxiv.org/abs/2011.12982v1","paper_title":"Grafit: Learning fine-grained image representations with coarse labels","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":16,"model":"CaiT-M-36 U 224","metrics":{"Accuracy":"99.1"},"uses_additional_data":true,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":17,"model":"DAT","metrics":{"Accuracy":"98.9%"},"uses_additional_data":true,"paper_date":"2020-10-06","paper":"/paper/domain-adaptive-transfer-learning-on-visual","paper_url":"https://arxiv.org/abs/2010.03071v1","paper_title":"Domain Adaptive Transfer Learning on Visual Attention Aware Data Augmentation for Fine-grained Visual Categorization","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":18,"model":"EfficientNet-B7","metrics":{"Accuracy":"98.8%"},"uses_additional_data":true,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":19,"model":"EfficientNetV2-L","metrics":{"Accuracy":"98.8"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":20,"model":"GFNet-H-B","metrics":{"Accuracy":"98.8","PARAMS":"54M"},"uses_additional_data":true,"paper_date":"2021-07-01","paper":"/paper/global-filter-networks-for-image","paper_url":"https://arxiv.org/abs/2107.00645v2","paper_title":"Global Filter Networks for Image Classification","code":"https://github.com/raoyongming/GFNet","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":5}},{"rank_in_archive_order":21,"model":"DeiT-B","metrics":{"Accuracy":"98.8%","PARAMS":"86M"},"uses_additional_data":true,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":22,"model":"CeiT-S (384 finetune resolution)","metrics":{"Accuracy":"98.6"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":23,"model":"EfficientNetV2-M","metrics":{"Accuracy":"98.5"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":24,"model":"ViT-B (attn finetune)","metrics":{"Accuracy":"98.5"},"uses_additional_data":true,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":25,"model":"LeViT-384","metrics":{"Accuracy":"98.3"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":26,"model":"NAT-M4","metrics":{"Accuracy":"98.3%","FLOPS":"400M","PARAMS":"4.2M"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":27,"model":"ResNet-50x1-ACG (ImageNet-21K)","metrics":{"Accuracy":"98.21"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/effect-of-large-scale-pre-training-on-full","paper_url":"https://arxiv.org/abs/2106.00116v4","paper_title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","code":"https://github.com/SLAMPAI/large-scale-pretraining-transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"CeiT-S","metrics":{"Accuracy":"98.2"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"NAT-M3","metrics":{"Accuracy":"98.1%","FLOPS":"250M","PARAMS":"3.7M"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":30,"model":"ResNet50 (A1)","metrics":{"Accuracy":"97.9","FLOPS":"4.1","PARAMS":"25M"},"uses_additional_data":true,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":31,"model":"EfficientNetV2-S","metrics":{"Accuracy":"97.9"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":32,"model":"ResMLP24","metrics":{"Accuracy":"97.9"},"uses_additional_data":true,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":33,"model":"NAT-M2","metrics":{"Accuracy":"97.9%","FLOPS":"195M","PARAMS":"3.4M"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":34,"model":"TransBoost-ResNet50","metrics":{"Accuracy":"97.85%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":35,"model":"CeiT-T (384 finetune resolution)","metrics":{"Accuracy":"97.8"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"LeViT-192","metrics":{"Accuracy":"97.8"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":37,"model":"LeViT-256","metrics":{"Accuracy":"97.7"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"ResMLP12","metrics":{"Accuracy":"97.4"},"uses_additional_data":true,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":39,"model":"CS-Parts","metrics":{"Accuracy":"96.9%"},"uses_additional_data":true,"paper_date":"2019-09-16","paper":"/paper/classification-specific-parts-for-improving","paper_url":"https://arxiv.org/abs/1909.07075v1","paper_title":"Classification-Specific Parts for Improving Fine-Grained Visual Categorization","code":"https://github.com/DiKorsch/l1_parts","n_code_links":2,"syntology":null},{"rank_in_archive_order":40,"model":"CeiT-T","metrics":{"Accuracy":"96.9"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"LeViT-128S","metrics":{"Accuracy":"96.8"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":42,"model":"SEER (RegNet10B)","metrics":{"Accuracy":"96.3"},"uses_additional_data":true,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":43,"model":"NNCLR","metrics":{"Accuracy":"95.1"},"uses_additional_data":true,"paper_date":"2021-04-29","paper":"/paper/with-a-little-help-from-my-friends-nearest","paper_url":"https://arxiv.org/abs/2104.14548v2","paper_title":"With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations","code":"https://github.com/lightly-ai/lightly","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":44,"model":"ViT-B/16- SAM","metrics":{"Accuracy":"91.8"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":45,"model":"ViT-S/16- SAM","metrics":{"Accuracy":"91.5"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":46,"model":"ResNet-152-SAM","metrics":{"Accuracy":"91.1"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":47,"model":"ResNet-50-SAM","metrics":{"Accuracy":"90"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":48,"model":"Mixer-B/16- SAM","metrics":{"Accuracy":"90"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":49,"model":"MANO-tiny","metrics":{"Accuracy":"89.00"},"uses_additional_data":true,"paper_date":"2025-07-03","paper":"/paper/linear-attention-with-global-context-a-1","paper_url":"https://arxiv.org/abs/2507.02748v1","paper_title":"Linear Attention with Global Context: A Multipole Attention Mechanism for Vision and Physics","code":"https://github.com/AlexColagrande/MANO","n_code_links":1,"syntology":null},{"rank_in_archive_order":50,"model":"Mixer-S/16- SAM","metrics":{"Accuracy":"87.9"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":51,"model":"Diffusion Classifier (zero-shot)","metrics":{"Per-Class Accuracy":"66.3"},"uses_additional_data":false,"paper_date":"2023-03-28","paper":"/paper/your-diffusion-model-is-secretly-a-zero-shot","paper_url":"https://arxiv.org/abs/2303.16203v3","paper_title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","code":"https://github.com/diffusion-classifier/diffusion-classifier","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":52,"model":"NAT-M1","metrics":{"FLOPS":"152M","PARAMS":"3.3M"},"uses_additional_data":false,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":35,"rows_with_any_sample_ran":28,"distinct_papers_with_graph_line":21,"distinct_papers_with_any_sample_ran":18,"samples_over_distinct_papers":{"n_ran":611,"n_unverified":388,"n_samples":999,"n_pointer_only_licence":311,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":794,"n_unverified":509,"n_samples":1303,"n_pointer_only_licence":334,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}