{"url":"/sota/image-classification-on-cifar-100","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"CIFAR-100","url":"/dataset/cifar-100"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Percentage correct","PARAMS","Accuracy","Top 1 Accuracy"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Percentage correct":null,"PARAMS":"lower","Accuracy":"higher","Top 1 Accuracy":"higher"}},"counts":{"rows":211,"rows_with_code":188,"rows_with_paper_page":208,"rows_dated":208,"rows_using_additional_data":155},"rows":[{"rank_in_archive_order":1,"model":"EffNet-L2 (SAM)","metrics":{"Percentage correct":"96.08"},"uses_additional_data":true,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":2,"model":"Swin-L + ML-Decoder","metrics":{"Percentage correct":"95.1"},"uses_additional_data":true,"paper_date":"2021-11-25","paper":"/paper/ml-decoder-scalable-and-versatile","paper_url":"https://arxiv.org/abs/2111.12933v2","paper_title":"ML-Decoder: Scalable and Versatile Classification Head","code":"https://github.com/alibaba-miil/ml_decoder","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"µ2Net (ViT-L/16)","metrics":{"Percentage correct":"94.95"},"uses_additional_data":true,"paper_date":"2022-05-25","paper":"/paper/an-evolutionary-approach-to-dynamic","paper_url":"https://arxiv.org/abs/2205.12755v6","paper_title":"An Evolutionary Approach to Dynamic Introduction of Tasks in Large-scale Multitask Learning Systems","code":"https://github.com/google-research/google-research/tree/master/muNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"ViT-B-16 (ImageNet-21K-P pretrain)","metrics":{"Percentage correct":"94.2"},"uses_additional_data":true,"paper_date":"2021-04-22","paper":"/paper/imagenet-21k-pretraining-for-the-masses","paper_url":"https://arxiv.org/abs/2104.10972v4","paper_title":"ImageNet-21K Pretraining for the Masses","code":"https://github.com/Alibaba-MIIL/ImageNet21K","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"CvT-W24","metrics":{"Percentage correct":"94.09"},"uses_additional_data":true,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":38,"n_unverified":9,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":6,"model":"ViT-B/16 (PUGD)","metrics":{"Percentage correct":"93.95"},"uses_additional_data":true,"paper_date":"2021-10-01","paper":"/paper/update-in-unit-gradient","paper_url":"https://arxiv.org/abs/2110.00199v2","paper_title":"Perturbated Gradients Updating within Unit Space for Deep Learning","code":"https://github.com/hanktseng131415go/pugd","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"Heinsen Routing + BEiT-large 16 224","metrics":{"PARAMS":"309.8M","Percentage correct":"93.8"},"uses_additional_data":true,"paper_date":"2022-11-20","paper":"/paper/an-algorithm-for-routing-vectors-in-sequences","paper_url":"https://arxiv.org/abs/2211.11754v3","paper_title":"An Algorithm for Routing Vectors in Sequences","code":"https://github.com/glassroom/heinsen_routing","n_code_links":1,"syntology":null},{"rank_in_archive_order":8,"model":"BiT-L (ResNet)","metrics":{"Percentage correct":"93.51"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"VIT-L/16 (Spinal FC, Background)","metrics":{"Percentage correct":"93.31"},"uses_additional_data":false,"paper_date":"2023-05-05","paper":"/paper/reduction-of-class-activation-uncertainty","paper_url":"https://arxiv.org/abs/2305.03238v6","paper_title":"Reduction of Class Activation Uncertainty with Background Information","code":"https://github.com/dipuk0506/SpinalNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":10,"model":"CaiT-M-36 U 224","metrics":{"Percentage correct":"93.1"},"uses_additional_data":true,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":11,"model":"ViT-L (attn fine-tune)","metrics":{"Percentage correct":"93.0"},"uses_additional_data":true,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"TResNet-L-V2","metrics":{"Percentage correct":"92.6"},"uses_additional_data":true,"paper_date":"2020-03-30","paper":"/paper/tresnet-high-performance-gpu-dedicated","paper_url":"https://arxiv.org/abs/2003.13630v3","paper_title":"TResNet: High Performance GPU-Dedicated Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":13,"model":"EfficientNetV2-L","metrics":{"Percentage correct":"92.3"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":14,"model":"EfficientNetV2-M","metrics":{"Percentage correct":"92.2"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":15,"model":"BiT-M (ResNet)","metrics":{"Percentage correct":"92.17"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":16,"model":"CeiT-S","metrics":{"Percentage correct":"91.8"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"CeiT-S (384 finetune resolution)","metrics":{"Percentage correct":"91.8"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":18,"model":"EfficientNet-B7","metrics":{"PARAMS":"64M","Percentage correct":"91.7"},"uses_additional_data":true,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":198,"n_unverified":104,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":19,"model":"EfficientNetV2-S","metrics":{"Percentage correct":"91.5"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":20,"model":"GPIPE","metrics":{"Percentage correct":"91.3"},"uses_additional_data":true,"paper_date":"2018-11-16","paper":"/paper/gpipe-efficient-training-of-giant-neural","paper_url":"https://arxiv.org/abs/1811.06965v5","paper_title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","code":"https://github.com/tensorflow/lingvo","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":24,"n_samples":25,"n_pointer_only_licence":16}},{"rank_in_archive_order":21,"model":"TNT-B","metrics":{"PARAMS":"65.6M","Percentage correct":"91.1"},"uses_additional_data":true,"paper_date":"2021-02-27","paper":"/paper/transformer-in-transformer","paper_url":"https://arxiv.org/abs/2103.00112v3","paper_title":"Transformer in Transformer","code":"https://github.com/rwightman/pytorch-image-models/blob/master/timm/models/tnt.py","n_code_links":12,"syntology":{"n_ran":16,"n_unverified":8,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":22,"model":"DeiT-B","metrics":{"PARAMS":"86M","Percentage correct":"90.8"},"uses_additional_data":true,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":23,"model":"GFNet-H-B","metrics":{"PARAMS":"54M","Percentage correct":"90.3"},"uses_additional_data":true,"paper_date":"2021-07-01","paper":"/paper/global-filter-networks-for-image","paper_url":"https://arxiv.org/abs/2107.00645v2","paper_title":"Global Filter Networks for Image Classification","code":"https://github.com/raoyongming/GFNet","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":5}},{"rank_in_archive_order":24,"model":"E2E-3M","metrics":{"Percentage correct":"90.27"},"uses_additional_data":true,"paper_date":"2020-07-30","paper":"/paper/rethinking-recurrent-neural-networks-and","paper_url":"https://arxiv.org/abs/2007.15161v3","paper_title":"Rethinking Recurrent Neural Networks and Other Improvements for Image Classification","code":"https://github.com/leonlha/e2e-3m","n_code_links":1,"syntology":null},{"rank_in_archive_order":25,"model":"Bamboo (ViT-B/16)","metrics":{"Percentage correct":"90.2"},"uses_additional_data":true,"paper_date":"2022-03-15","paper":"/paper/bamboo-building-mega-scale-vision-dataset","paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","code":"https://github.com/zhangyuanhan-ai/bamboo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":26,"model":"PyramidNet-272 (ASAM)","metrics":{"Percentage correct":"89.90"},"uses_additional_data":false,"paper_date":"2021-02-23","paper":"/paper/asam-adaptive-sharpness-aware-minimization","paper_url":"https://arxiv.org/abs/2102.11600v3","paper_title":"ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks","code":"https://github.com/davda54/sam","n_code_links":2,"syntology":null},{"rank_in_archive_order":27,"model":"PyramidNet (SAM)","metrics":{"Percentage correct":"89.7"},"uses_additional_data":false,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":28,"model":"DVT (T2T-ViT-24)","metrics":{"Percentage correct":"89.63"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/not-all-images-are-worth-16x16-words-dynamic","paper_url":"https://arxiv.org/abs/2105.15075v2","paper_title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","code":"https://github.com/blackfeather-wang/Dynamic-Vision-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":29,"model":"ResMLP-24","metrics":{"Percentage correct":"89.5"},"uses_additional_data":true,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":30,"model":"PyramidNet-272, S=4","metrics":{"PARAMS":"32.8M","Percentage correct":"89.46"},"uses_additional_data":true,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":31,"model":"CeiT-T","metrics":{"Percentage correct":"89.4"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":32,"model":"PyramidNet+ShakeDrop","metrics":{"Percentage correct":"89.3"},"uses_additional_data":true,"paper_date":"2018-05-24","paper":"/paper/autoaugment-learning-augmentation-policies","paper_url":"http://arxiv.org/abs/1805.09501v3","paper_title":"AutoAugment: Learning Augmentation Policies from Data","code":"https://github.com/tensorflow/models/tree/master/research/autoaugment","n_code_links":33,"syntology":{"n_ran":7,"n_unverified":36,"n_samples":43,"n_pointer_only_licence":2}},{"rank_in_archive_order":33,"model":"ViT-B/16- SAM","metrics":{"Percentage correct":"89.1"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":34,"model":"ConvMLP-M","metrics":{"Percentage correct":"89.1"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":35,"model":"ConvMLP-L","metrics":{"Percentage correct":"88.6"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":36,"model":"ResNet-152x4-AGC (ImageNet-21K)","metrics":{"Percentage correct":"88.54"},"uses_additional_data":true,"paper_date":"2021-05-31","paper":"/paper/effect-of-large-scale-pre-training-on-full","paper_url":"https://arxiv.org/abs/2106.00116v4","paper_title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","code":"https://github.com/SLAMPAI/large-scale-pretraining-transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"ColorNet","metrics":{"PARAMS":"19.0M","Percentage correct":"88.4"},"uses_additional_data":true,"paper_date":"2019-02-01","paper":"/paper/colornet-investigating-the-importance-of","paper_url":"http://arxiv.org/abs/1902.00267v1","paper_title":"ColorNet: Investigating the importance of color spaces for image classification","code":"https://github.com/kini5gowda/ColorNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":38,"model":"PyramidNet+ShakeDrop (Fast AA)","metrics":{"Percentage correct":"88.3"},"uses_additional_data":true,"paper_date":"2019-05-01","paper":"/paper/fast-autoaugment","paper_url":"https://arxiv.org/abs/1905.00397v2","paper_title":"Fast AutoAugment","code":"https://github.com/kakaobrain/fast-autoaugment","n_code_links":11,"syntology":{"n_ran":32,"n_unverified":8,"n_samples":40,"n_pointer_only_licence":3}},{"rank_in_archive_order":39,"model":"NAT-M4","metrics":{"PARAMS":"9.0M","Percentage correct":"88.3"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":40,"model":"CeiT-T (384 finetune resolution)","metrics":{"Percentage correct":"88"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"NAT-M3","metrics":{"PARAMS":"7.8M","Percentage correct":"87.7"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":42,"model":"ViT-S/16- SAM","metrics":{"Percentage correct":"87.6"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":43,"model":"NAT-M2","metrics":{"PARAMS":"6.4M","Percentage correct":"87.5"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":44,"model":"Dynamics 1","metrics":{"Percentage correct":"87.48"},"uses_additional_data":true,"paper_date":"2022-05-20","paper":"/paper/pso-convolutional-neural-networks-with","paper_url":"https://arxiv.org/abs/2205.10456v3","paper_title":"PSO-Convolutional Neural Networks with Heterogeneous Learning Rate","code":"https://github.com/leonlha/pso-convnet-dynamics","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"DenseNet-BC-190, S=4","metrics":{"PARAMS":"26.3M","Percentage correct":"87.44"},"uses_additional_data":true,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":46,"model":"ConvMLP-S","metrics":{"Percentage correct":"87.4"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":47,"model":"ResMLP-12","metrics":{"Percentage correct":"87.0"},"uses_additional_data":true,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":5,"n_unverified":2,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"WRN-40-10, S=4","metrics":{"Percentage correct":"86.90"},"uses_additional_data":true,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":49,"model":"ResNet50 (A1)","metrics":{"PARAMS":"25M","Percentage correct":"86.9"},"uses_additional_data":true,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":50,"model":"WRN-28-10 * 3","metrics":{"Percentage correct":"86.81"},"uses_additional_data":true,"paper_date":"2021-03-10","paper":"/paper/mixmo-mixing-multiple-inputs-for-multiple","paper_url":"https://arxiv.org/abs/2103.06132v3","paper_title":"MixMo: Mixing Multiple Inputs for Multiple Outputs via Deep Subnetworks","code":"https://github.com/alexrame/mixmo-pytorch","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":51,"model":"PyramidNet + AA (AMP)","metrics":{"Percentage correct":"86.64"},"uses_additional_data":true,"paper_date":"2020-10-10","paper":"/paper/regularizing-neural-networks-via-adversarial","paper_url":"https://arxiv.org/abs/2010.04925v4","paper_title":"Regularizing Neural Networks via Adversarial Model Perturbation","code":"https://github.com/hiyouga/AMP-Regularizer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":52,"model":"PyramidNet-200 + Shakedrop + Cutmix + PS-KD","metrics":{"Percentage correct":"86.41"},"uses_additional_data":true,"paper_date":"2020-06-22","paper":"/paper/self-knowledge-distillation-a-simple-way-for","paper_url":"https://arxiv.org/abs/2006.12000v3","paper_title":"Self-Knowledge Distillation with Progressive Refinement of Targets","code":"https://github.com/lgcnsai/ps-kd-pytorch","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"Mixer-B/16- SAM","metrics":{"Percentage correct":"86.4"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":54,"model":"ResCNet-50","metrics":{"Percentage correct":"86.31"},"uses_additional_data":false,"paper_date":"2024-11-16","paper":"/paper/deep-feature-response-discriminative","paper_url":"https://arxiv.org/abs/2411.13582v1","paper_title":"Deep Feature Response Discriminative Calibration","code":"https://github.com/tcmyxc/rescnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"PyramidNet-200 + Shakedrop + Cutmix","metrics":{"Percentage correct":"86.19"},"uses_additional_data":true,"paper_date":"2019-05-13","paper":"/paper/cutmix-regularization-strategy-to-train","paper_url":"https://arxiv.org/abs/1905.04899v2","paper_title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":30,"syntology":{"n_ran":17,"n_unverified":7,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":56,"model":"MUXNet-m","metrics":{"PARAMS":"2.1M","Percentage correct":"86.1"},"uses_additional_data":true,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":57,"model":"NAT-M1","metrics":{"PARAMS":"3.8M","Percentage correct":"86.0"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":58,"model":"WRN-28-10","metrics":{"Percentage correct":"85.77"},"uses_additional_data":true,"paper_date":"2021-03-10","paper":"/paper/mixmo-mixing-multiple-inputs-for-multiple","paper_url":"https://arxiv.org/abs/2103.06132v3","paper_title":"MixMo: Mixing Multiple Inputs for Multiple Outputs via Deep Subnetworks","code":"https://github.com/alexrame/mixmo-pytorch","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":59,"model":"WRN-28-10, S=4","metrics":{"Percentage correct":"85.74"},"uses_additional_data":true,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":60,"model":"WRN-28-8 (SAMix+DM)","metrics":{"Percentage correct":"85.59"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":61,"model":"WRN-28-8 +SAMix","metrics":{"Percentage correct":"85.50"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":62,"model":"ASANas","metrics":{"Percentage correct":"85.42"},"uses_additional_data":true,"paper_date":"2019-03-14","paper":"/paper/improving-neural-architecture-search-image","paper_url":"http://arxiv.org/abs/1903.06236v1","paper_title":"Improving Neural Architecture Search Image Classifiers via Ensemble Learning","code":"https://github.com/tensorflow/adanet","n_code_links":1,"syntology":null},{"rank_in_archive_order":63,"model":"WRN-28-8 (AutoMix+DM)","metrics":{"Percentage correct":"85.38"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":64,"model":"SparseSwin","metrics":{"PARAMS":"17.58M","Percentage correct":"85.35"},"uses_additional_data":true,"paper_date":"2023-09-11","paper":"/paper/sparseswin-swin-transformer-with-sparse","paper_url":"https://arxiv.org/abs/2309.05224v1","paper_title":"SparseSwin: Swin Transformer with Sparse Transformer Block","code":"https://github.com/krisnapinasthika/sparseswin","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"WRN-28-8 (PuzzleMix+DM)","metrics":{"Percentage correct":"85.25"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":66,"model":"ResNet-50-SAM","metrics":{"Percentage correct":"85.2"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":67,"model":"WRN-28-8 +AutoMix","metrics":{"Percentage correct":"85.16"},"uses_additional_data":true,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"WaveMixLite-256/7","metrics":{"Percentage correct":"85.09"},"uses_additional_data":true,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":69,"model":"MANO-tiny","metrics":{"Percentage correct":"85.08"},"uses_additional_data":true,"paper_date":"2025-07-03","paper":"/paper/linear-attention-with-global-context-a-1","paper_url":"https://arxiv.org/abs/2507.02748v1","paper_title":"Linear Attention with Global Context: A Multipole Attention Mechanism for Vision and Physics","code":"https://github.com/AlexColagrande/MANO","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"WRN 28-14","metrics":{"Percentage correct":"85.00"},"uses_additional_data":true,"paper_date":"2020-07-25","paper":"/paper/economical-ensembles-with-hypernetworks","paper_url":"https://arxiv.org/abs/2007.12927v4","paper_title":"Neural networks with late-phase weights","code":"https://github.com/google/uncertainty-baselines","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":71,"model":"R-Mix (WideResNet 28-10)","metrics":{"Percentage correct":"85"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":72,"model":"EEEA-Net-C (b=5)+ CO","metrics":{"Percentage correct":"84.98"},"uses_additional_data":true,"paper_date":"2021-08-13","paper":"/paper/eeea-net-an-early-exit-evolutionary-neural","paper_url":"https://arxiv.org/abs/2108.06156v1","paper_title":"EEEA-Net: An Early Exit Evolutionary Neural Architecture Search","code":"https://github.com/chakkritte/eeea-net","n_code_links":1,"syntology":null},{"rank_in_archive_order":73,"model":"RL-Mix (WideResNet 28-10)","metrics":{"Percentage correct":"84.9"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":74,"model":"Wide-ResNet-28-10","metrics":{"Percentage correct":"84.89"},"uses_additional_data":true,"paper_date":"2022-09-29","paper":"/paper/automatic-data-augmentation-via-invariance","paper_url":"https://arxiv.org/abs/2209.15031v2","paper_title":"Automatic Data Augmentation via Invariance-Constrained Learning","code":"https://github.com/ihounie/daug","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":75,"model":"SENet + ShakeEven + Cutout","metrics":{"Percentage correct":"84.59"},"uses_additional_data":true,"paper_date":"2017-09-05","paper":"/paper/squeeze-and-excitation-networks","paper_url":"https://arxiv.org/abs/1709.01507v4","paper_title":"Squeeze-and-Excitation Networks","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":85,"syntology":{"n_ran":2,"n_unverified":7,"n_samples":9,"n_pointer_only_licence":6}},{"rank_in_archive_order":76,"model":"ResNeXt-50(32x4d) + SAMix","metrics":{"Percentage correct":"84.42"},"uses_additional_data":true,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"WRN-28-10 with reSGHMC","metrics":{"Percentage correct":"84.38"},"uses_additional_data":true,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":78,"model":"PyramidNet-272 + SWA","metrics":{"Percentage correct":"84.16"},"uses_additional_data":true,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":79,"model":"WRN28-10","metrics":{"Percentage correct":"84.05"},"uses_additional_data":true,"paper_date":"2020-09-15","paper":"/paper/puzzle-mix-exploiting-saliency-and-local-1","paper_url":"https://arxiv.org/abs/2009.06962v2","paper_title":"Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup","code":"https://github.com/snu-mllab/PuzzleMix","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"HCGNet-A3","metrics":{"PARAMS":"11.4M","Percentage correct":"84.04"},"uses_additional_data":true,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":81,"model":"WideResNet 28-10 + CutMix (OneCycleLR scheduler)","metrics":{"Percentage correct":"83.97"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":82,"model":"DenseNet-BC-190 + FMix","metrics":{"Percentage correct":"83.95"},"uses_additional_data":true,"paper_date":"2020-02-27","paper":"/paper/understanding-and-enhancing-mixed-sample-data","paper_url":"https://arxiv.org/abs/2002.12047v3","paper_title":"FMix: Enhancing Mixed Sample Data Augmentation","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":5,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":3}},{"rank_in_archive_order":83,"model":"ORN","metrics":{"Percentage correct":"83.85"},"uses_additional_data":true,"paper_date":"2017-01-07","paper":"/paper/oriented-response-networks","paper_url":"http://arxiv.org/abs/1701.01833v2","paper_title":"Oriented Response Networks","code":"https://github.com/ZhouYanzhao/ORN","n_code_links":1,"syntology":null},{"rank_in_archive_order":84,"model":"Grafit (ResNet-50)","metrics":{"Percentage correct":"83.7"},"uses_additional_data":true,"paper_date":"2020-11-25","paper":"/paper/grafit-learning-fine-grained-image","paper_url":"https://arxiv.org/abs/2011.12982v1","paper_title":"Grafit: Learning fine-grained image representations with coarse labels","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":85,"model":"ResNeXt-50(32x4d) + AutoMix","metrics":{"Percentage correct":"83.64"},"uses_additional_data":true,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"CCT-7/3x1+HTM+VTM","metrics":{"Percentage correct":"83.57"},"uses_additional_data":true,"paper_date":"2022-10-14","paper":"/paper/tokenmixup-efficient-attention-guided-token","paper_url":"https://arxiv.org/abs/2210.07562v1","paper_title":"TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers","code":"https://github.com/mlvlab/tokenmixup","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":87,"model":"HCGNet-A2","metrics":{"PARAMS":"3.1M","Percentage correct":"83.46"},"uses_additional_data":true,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":88,"model":"Res2NeXt-29","metrics":{"Percentage correct":"83.44"},"uses_additional_data":true,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":89,"model":"DenseNet-BC-190 + Mixup","metrics":{"Percentage correct":"83.20"},"uses_additional_data":true,"paper_date":"2017-10-25","paper":"/paper/mixup-beyond-empirical-risk-minimization","paper_url":"http://arxiv.org/abs/1710.09412v2","paper_title":"mixup: Beyond Empirical Risk Minimization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":71,"syntology":{"n_ran":32,"n_unverified":15,"n_samples":47,"n_pointer_only_licence":15}},{"rank_in_archive_order":90,"model":"SSAL-DenseNet 190-40","metrics":{"Percentage correct":"83.2"},"uses_additional_data":true,"paper_date":"2021-01-07","paper":"/paper/contextual-classification-using-self","paper_url":"https://arxiv.org/abs/2101.03057v1","paper_title":"Contextual Classification Using Self-Supervised Auxiliary Models for Deep Neural Networks","code":"https://github.com/Engler93/Self-Supervised-Autogenous-Learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":91,"model":"EnAET","metrics":{"Percentage correct":"83.13"},"uses_additional_data":true,"paper_date":"2019-11-21","paper":"/paper/enaet-self-trained-ensemble-autoencoding","paper_url":"https://arxiv.org/abs/1911.09265v2","paper_title":"EnAET: A Self-Trained framework for Semi-Supervised and Supervised Learning with Ensemble Transformations","code":"https://github.com/maple-research-lab/EnAET","n_code_links":2,"syntology":null},{"rank_in_archive_order":92,"model":"WRN 28-10","metrics":{"Percentage correct":"83.06"},"uses_additional_data":true,"paper_date":"2020-07-25","paper":"/paper/economical-ensembles-with-hypernetworks","paper_url":"https://arxiv.org/abs/2007.12927v4","paper_title":"Neural networks with late-phase weights","code":"https://github.com/google/uncertainty-baselines","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":93,"model":"R-Mix (ResNeXt 29-4-24)","metrics":{"Percentage correct":"83.02"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":94,"model":"Wide ResNet+Cutout+no BN scale/offset learning","metrics":{"Percentage correct":"82.95"},"uses_additional_data":true,"paper_date":"2019-07-16","paper":"/paper/single-bit-per-weight-deep-convolutional","paper_url":"https://arxiv.org/abs/1907.06916v2","paper_title":"Single-bit-per-weight deep convolutional neural networks without batch-normalization layers for embedded systems","code":"https://github.com/McDonnell-Lab/1-bit-per-weight","n_code_links":1,"syntology":null},{"rank_in_archive_order":95,"model":"WRN-16-8 with reSGHMC","metrics":{"Percentage correct":"82.95"},"uses_additional_data":true,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":96,"model":"DenseNet-BC","metrics":{"Percentage correct":"82.82"},"uses_additional_data":true,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":21,"n_unverified":50,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":97,"model":"ABNet-2G-R3-Combined","metrics":{"Percentage correct":"82.784"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":98,"model":"CCT-7/3x1*","metrics":{"Percentage correct":"82.72"},"uses_additional_data":true,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":99,"model":"EXACT (WRN-28-10)","metrics":{"Percentage correct":"82.68"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/exact-how-to-train-your-accuracy","paper_url":"https://arxiv.org/abs/2205.09615v5","paper_title":"EXACT: How to Train Your Accuracy","code":"https://github.com/tinkoff-ai/exact","n_code_links":2,"syntology":null},{"rank_in_archive_order":100,"model":"SKNet-29 (ResNeXt-29, 16×32d)","metrics":{"Percentage correct":"82.67"},"uses_additional_data":true,"paper_date":"2019-03-15","paper":"/paper/selective-kernel-networks","paper_url":"http://arxiv.org/abs/1903.06586v2","paper_title":"Selective Kernel Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":101,"model":"DenseNet","metrics":{"Percentage correct":"82.62"},"uses_additional_data":true,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":21,"n_unverified":50,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":102,"model":"Shared WRN","metrics":{"Percentage correct":"82.57"},"uses_additional_data":true,"paper_date":"2019-02-26","paper":"/paper/learning-implicitly-recurrent-cnns-through","paper_url":"http://arxiv.org/abs/1902.09701v2","paper_title":"Learning Implicitly Recurrent CNNs Through Parameter Sharing","code":"https://github.com/lolemacs/soft-sharing","n_code_links":1,"syntology":null},{"rank_in_archive_order":103,"model":"Transformer local-attention (NesT-B)","metrics":{"Percentage correct":"82.56"},"uses_additional_data":true,"paper_date":"2021-05-26","paper":"/paper/aggregating-nested-transformers","paper_url":"https://arxiv.org/abs/2105.12723v4","paper_title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":104,"model":"RL-Mix (ResNeXt 29-4-24)","metrics":{"Percentage correct":"82.43"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":105,"model":"Mixer-S/16- SAM","metrics":{"Percentage correct":"82.4"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":106,"model":"R-Mix (WideResNet 16-8)","metrics":{"Percentage correct":"82.32"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":107,"model":"ResNeXt 29-4-24 + CutMix (OneCycleLR scheduler)","metrics":{"Percentage correct":"82.3"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":108,"model":"WARN","metrics":{"Percentage correct":"82.18"},"uses_additional_data":true,"paper_date":"2018-07-19","paper":"/paper/attend-and-rectify-a-gated-attention","paper_url":"http://arxiv.org/abs/1807.07320v2","paper_title":"Attend and Rectify: a Gated Attention Mechanism for Fine-Grained Recovery","code":"https://github.com/prlz77/attend-and-rectify","n_code_links":1,"syntology":null},{"rank_in_archive_order":109,"model":"RL-Mix (WideResNet 16-8)","metrics":{"Percentage correct":"82.16"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":110,"model":"WRN+SWA","metrics":{"Percentage correct":"82.15"},"uses_additional_data":true,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":111,"model":"Manifold Mixup","metrics":{"Percentage correct":"81.96"},"uses_additional_data":true,"paper_date":"2018-06-13","paper":"/paper/manifold-mixup-better-representations-by","paper_url":"https://arxiv.org/abs/1806.05236v7","paper_title":"Manifold Mixup: Better Representations by Interpolating Hidden States","code":"https://github.com/Westlake-AI/openmixup","n_code_links":12,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":5}},{"rank_in_archive_order":112,"model":"HCGNet-A1","metrics":{"PARAMS":"1.1M","Percentage correct":"81.87"},"uses_additional_data":true,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":113,"model":"WideResNet 16-8 + CutMix (OneCycleLR scheduler)","metrics":{"Percentage correct":"81.79"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":114,"model":"Residual Gates + WRN","metrics":{"Percentage correct":"81.73"},"uses_additional_data":true,"paper_date":"2016-11-04","paper":"/paper/learning-identity-mappings-with-residual","paper_url":"http://arxiv.org/abs/1611.01260v2","paper_title":"Learning Identity Mappings with Residual Gates","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":115,"model":"kNN-CLIP","metrics":{"Percentage correct":"81.7"},"uses_additional_data":true,"paper_date":"2022-04-03","paper":"/paper/revisiting-a-knn-based-image-classification","paper_url":"https://arxiv.org/abs/2204.01186v2","paper_title":"Revisiting a kNN-based Image Classification System with High-capacity Storage","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":116,"model":"AA-Wide-ResNet","metrics":{"Percentage correct":"81.6"},"uses_additional_data":true,"paper_date":"2019-04-22","paper":"/paper/190409925","paper_url":"https://arxiv.org/abs/1904.09925v5","paper_title":"Attention Augmented Convolutional Networks","code":"https://github.com/leaderj1001/Attention-Augmented-Conv2d","n_code_links":14,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":117,"model":"PDO-eConv (p8, 4.6M)","metrics":{"Percentage correct":"81.6"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"SEER (RegNet10B)","metrics":{"Percentage correct":"81.53"},"uses_additional_data":true,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":119,"model":"R-Mix (PreActResNet-18)","metrics":{"Percentage correct":"81.49"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":120,"model":"ResNet50 (FSGDM)","metrics":{"Percentage correct":"81.44"},"uses_additional_data":false,"paper_date":"2024-11-29","paper":"/paper/on-the-performance-analysis-of-momentum","paper_url":"https://arxiv.org/abs/2411.19671v6","paper_title":"On the Performance Analysis of Momentum Method: A Frequency Domain Perspective","code":"https://github.com/yinleung/FSGDM","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"Wide-ResNet-40-2","metrics":{"Percentage correct":"81.19"},"uses_additional_data":true,"paper_date":"2022-09-29","paper":"/paper/automatic-data-augmentation-via-invariance","paper_url":"https://arxiv.org/abs/2209.15031v2","paper_title":"Automatic Data Augmentation via Invariance-Constrained Learning","code":"https://github.com/ihounie/daug","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":122,"model":"Wide ResNet","metrics":{"Percentage correct":"81.15"},"uses_additional_data":true,"paper_date":"2016-05-23","paper":"/paper/wide-residual-networks","paper_url":"http://arxiv.org/abs/1605.07146v4","paper_title":"Wide Residual Networks","code":"https://github.com/tensorflow/models/tree/master/research/autoaugment","n_code_links":72,"syntology":{"n_ran":60,"n_unverified":36,"n_samples":96,"n_pointer_only_licence":46}},{"rank_in_archive_order":123,"model":"CoPaNet-R-164","metrics":{"Percentage correct":"81.10"},"uses_additional_data":true,"paper_date":"2017-09-29","paper":"/paper/deep-competitive-pathway-networks","paper_url":"http://arxiv.org/abs/1709.10282v1","paper_title":"Deep Competitive Pathway Networks","code":"https://github.com/JiaRenChang/CoPaNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":124,"model":"ABNet-2G-R3","metrics":{"Percentage correct":"80.830"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":125,"model":"RL-Mix (PreActResNet-18)","metrics":{"Percentage correct":"80.75"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":126,"model":"PreActResNet-18 + CutMix (OneCycleLR scheduler)","metrics":{"Percentage correct":"80.6"},"uses_additional_data":true,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":127,"model":"GAC-SNN","metrics":{"Percentage correct":"80.45"},"uses_additional_data":false,"paper_date":"2023-08-12","paper":"/paper/gated-attention-coding-for-training-high","paper_url":"https://arxiv.org/abs/2308.06582v2","paper_title":"Gated Attention Coding for Training High-performance and Efficient Spiking Neural Networks","code":"https://github.com/bollossom/GAC","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":12}},{"rank_in_archive_order":128,"model":"ABNet-2G-R2","metrics":{"Percentage correct":"80.354"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":129,"model":"SimpleNetv2","metrics":{"Percentage correct":"80.29"},"uses_additional_data":true,"paper_date":"2018-02-17","paper":"/paper/towards-principled-design-of-deep","paper_url":"http://arxiv.org/abs/1802.06205v1","paper_title":"Towards Principled Design of Deep Convolutional Networks: Introducing SimpNet","code":"https://github.com/Coderx7/SimpNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":130,"model":"UPANets","metrics":{"Percentage correct":"80.29"},"uses_additional_data":true,"paper_date":"2021-03-15","paper":"/paper/upanets-learning-from-the-universal-pixel","paper_url":"https://arxiv.org/abs/2103.08640v2","paper_title":"UPANets: Learning from the Universal Pixel Attention Networks","code":"https://github.com/hanktseng131415go/UPANets","n_code_links":1,"syntology":null},{"rank_in_archive_order":131,"model":"PreActResNet-18 + SageMix","metrics":{"Percentage correct":"80.16"},"uses_additional_data":true,"paper_date":"2022-10-13","paper":"/paper/sagemix-saliency-guided-mixup-for-point","paper_url":"https://arxiv.org/abs/2210.06944v1","paper_title":"SageMix: Saliency-Guided Mixup for Point Clouds","code":"https://github.com/mlvlab/SageMix","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":132,"model":"ResNet56 with reSGHMC","metrics":{"Percentage correct":"80.14"},"uses_additional_data":true,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":133,"model":"PDO-eConv (p8, 2.62M)","metrics":{"Percentage correct":"79.99"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":134,"model":"VGG11B(3x) + LocalLearning","metrics":{"Percentage correct":"79.9"},"uses_additional_data":true,"paper_date":"2019-01-20","paper":"/paper/training-neural-networks-with-local-error","paper_url":"https://arxiv.org/abs/1901.06656v2","paper_title":"Training Neural Networks with Local Error Signals","code":"https://github.com/anokland/local-loss","n_code_links":2,"syntology":null},{"rank_in_archive_order":135,"model":"NNCLR","metrics":{"Percentage correct":"79"},"uses_additional_data":true,"paper_date":"2021-04-29","paper":"/paper/with-a-little-help-from-my-friends-nearest","paper_url":"https://arxiv.org/abs/2104.14548v2","paper_title":"With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations","code":"https://github.com/lightly-ai/lightly","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"ABNet-2G-R1","metrics":{"Percentage correct":"78.792"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":137,"model":"PreActResNet18 (AMP)","metrics":{"Percentage correct":"78.49"},"uses_additional_data":true,"paper_date":"2020-10-10","paper":"/paper/regularizing-neural-networks-via-adversarial","paper_url":"https://arxiv.org/abs/2010.04925v4","paper_title":"Regularizing Neural Networks via Adversarial Model Perturbation","code":"https://github.com/hiyouga/AMP-Regularizer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":138,"model":"SimpleNetv1","metrics":{"Percentage correct":"78.37"},"uses_additional_data":true,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":139,"model":"ViT (lightweight, MAE pre-trained)","metrics":{"PARAMS":"3.64M","Percentage correct":"78.27"},"uses_additional_data":false,"paper_date":"2024-02-06","paper":"/paper/pre-training-of-lightweight-vision","paper_url":"https://arxiv.org/abs/2402.03752v1","paper_title":"Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":140,"model":"PDC","metrics":{"Percentage correct":"77.9"},"uses_additional_data":true,"paper_date":"2021-04-16","paper":"/paper/polynomial-networks-in-deep-classifiers","paper_url":"https://arxiv.org/abs/2104.07916v2","paper_title":"Augmenting Deep Classifiers with Polynomial Neural Networks","code":"https://github.com/grigorisg9gr/polynomials-for-augmenting-nns","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":141,"model":"MobileNetV3-large x1.0 (BSConv-U)","metrics":{"Percentage correct":"77.7"},"uses_additional_data":true,"paper_date":"2020-03-30","paper":"/paper/2003-13549","paper_url":"https://arxiv.org/abs/2003.13549v3","paper_title":"Rethinking Depthwise Separable Convolutions: How Intra-Kernel Correlations Lead to Improved MobileNets","code":"https://github.com/zeiss-microscopy/BSConv","n_code_links":1,"syntology":null},{"rank_in_archive_order":142,"model":"CCT-6/3x1","metrics":{"PARAMS":"3.17M","Percentage correct":"77.31"},"uses_additional_data":true,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":143,"model":"ResNet-1001","metrics":{"Percentage correct":"77.3"},"uses_additional_data":true,"paper_date":"2016-03-16","paper":"/paper/identity-mappings-in-deep-residual-networks","paper_url":"http://arxiv.org/abs/1603.05027v3","paper_title":"Identity Mappings in Deep Residual Networks","code":"https://github.com/tensorflow/models/tree/master/research/slim","n_code_links":54,"syntology":{"n_ran":5,"n_unverified":20,"n_samples":25,"n_pointer_only_licence":1}},{"rank_in_archive_order":144,"model":"Evolution","metrics":{"Percentage correct":"77"},"uses_additional_data":true,"paper_date":"2017-03-03","paper":"/paper/large-scale-evolution-of-image-classifiers","paper_url":"http://arxiv.org/abs/1703.01041v2","paper_title":"Large-Scale Evolution of Image Classifiers","code":"https://github.com/marijnvk/LargeScaleEvolution","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":145,"model":"DIANet","metrics":{"Percentage correct":"76.98"},"uses_additional_data":true,"paper_date":"2019-05-25","paper":"/paper/dianet-dense-and-implicit-attention-network","paper_url":"https://arxiv.org/abs/1905.10671v2","paper_title":"DIANet: Dense-and-Implicit Attention Network","code":"https://github.com/osmr/imgclsmob","n_code_links":3,"syntology":{"n_ran":5,"n_unverified":18,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":146,"model":"LP-BNN (ours) + cutout","metrics":{"Percentage correct":"76.85"},"uses_additional_data":true,"paper_date":"2020-12-04","paper":"/paper/encoding-the-latent-posterior-of-bayesian","paper_url":"https://arxiv.org/abs/2012.02818v2","paper_title":"Encoding the latent posterior of Bayesian Neural Networks for uncertainty quantification","code":"https://github.com/ENSTA-U2IS-AI/torch-uncertainty","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":147,"model":"ResNet-18+MM+FRL","metrics":{"Percentage correct":"76.64"},"uses_additional_data":true,"paper_date":"2020-11-22","paper":"/paper/towards-class-specific-unit","paper_url":"https://arxiv.org/abs/2011.10951v2","paper_title":"Learning Class Unique Features in Fine-Grained Visual Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":148,"model":"ResNet32 with reSGHMC","metrics":{"Percentage correct":"76.55"},"uses_additional_data":true,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":149,"model":"MomentumNet","metrics":{"Percentage correct":"76.38"},"uses_additional_data":true,"paper_date":"2021-02-15","paper":"/paper/momentum-residual-neural-networks","paper_url":"https://arxiv.org/abs/2102.07870v3","paper_title":"Momentum Residual Neural Networks","code":"https://github.com/michaelsdr/momentumnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":150,"model":"SSCNN","metrics":{"Percentage correct":"75.7"},"uses_additional_data":true,"paper_date":"2014-09-22","paper":"/paper/spatially-sparse-convolutional-neural","paper_url":"http://arxiv.org/abs/1409.6070v1","paper_title":"Spatially-sparse convolutional neural networks","code":"https://github.com/facebookresearch/SparseConvNet","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":151,"model":"Exponential Linear Units","metrics":{"Percentage correct":"75.7"},"uses_additional_data":true,"paper_date":"2015-11-23","paper":"/paper/fast-and-accurate-deep-network-learning-by","paper_url":"http://arxiv.org/abs/1511.07289v5","paper_title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Fast_and_Accurate_Deep_Network_Learning_by_Exponential_Linear_Units_ELUs","n_code_links":16,"syntology":{"n_ran":3,"n_unverified":4,"n_samples":7,"n_pointer_only_licence":2}},{"rank_in_archive_order":152,"model":"ResNet-9","metrics":{"Percentage correct":"75.59"},"uses_additional_data":true,"paper_date":"2022-03-29","paper":"/paper/cnn-filter-db-an-empirical-investigation-of","paper_url":"https://arxiv.org/abs/2203.15331v2","paper_title":"CNN Filter DB: An Empirical Investigation of Trained Convolutional Filters","code":"https://github.com/paulgavrikov/cnn-filter-db","n_code_links":1,"syntology":null},{"rank_in_archive_order":153,"model":"Stochastic Depth","metrics":{"Percentage correct":"75.42"},"uses_additional_data":true,"paper_date":"2016-03-30","paper":"/paper/deep-networks-with-stochastic-depth","paper_url":"http://arxiv.org/abs/1603.09382v3","paper_title":"Deep Networks with Stochastic Depth","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":8,"n_unverified":1,"n_samples":9,"n_pointer_only_licence":2}},{"rank_in_archive_order":154,"model":"ResNet v2-110 (Mish activation)","metrics":{"Percentage correct":"74.41"},"uses_additional_data":true,"paper_date":"2019-08-23","paper":"/paper/mish-a-self-regularized-non-monotonic-neural","paper_url":"https://arxiv.org/abs/1908.08681v3","paper_title":"Mish: A Self Regularized Non-Monotonic Activation Function","code":"https://github.com/tensorflow/addons","n_code_links":9,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":155,"model":"Dspike (ResNet-18)","metrics":{"Percentage correct":"74.24"},"uses_additional_data":false,"paper_date":"2021-12-01","paper":"/paper/differentiable-spike-rethinking-gradient","paper_url":"http://proceedings.neurips.cc/paper/2021/hash/c4ca4238a0b923820dcc509a6f75849b-Abstract.html","paper_title":"Differentiable Spike: Rethinking Gradient-Descent for Training Spiking Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":156,"model":"ResNet20 with reSGHMC","metrics":{"Percentage correct":"74.14"},"uses_additional_data":true,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":157,"model":"MixMatch","metrics":{"Percentage correct":"74.1"},"uses_additional_data":true,"paper_date":"2019-05-06","paper":"/paper/mixmatch-a-holistic-approach-to-semi","paper_url":"https://arxiv.org/abs/1905.02249v2","paper_title":"MixMatch: A Holistic Approach to Semi-Supervised Learning","code":"https://github.com/google-research/mixmatch","n_code_links":30,"syntology":{"n_ran":47,"n_unverified":16,"n_samples":63,"n_pointer_only_licence":32}},{"rank_in_archive_order":158,"model":"Beta-Rank","metrics":{"Accuracy":"74.01","Percentage correct":"74.01"},"uses_additional_data":false,"paper_date":"2023-04-15","paper":"/paper/beta-rank-a-robust-convolutional-filter","paper_url":"https://arxiv.org/abs/2304.07461v2","paper_title":"Beta-Rank: A Robust Convolutional Filter Pruning Method For Imbalanced Medical Image Analysis","code":"https://github.com/mohofar/beta-rank","n_code_links":1,"syntology":null},{"rank_in_archive_order":159,"model":"PreResNet-110","metrics":{"Percentage correct":"73.98"},"uses_additional_data":false,"paper_date":"2023-02-13","paper":"/paper/how-to-use-dropout-correctly-on-residual","paper_url":"https://arxiv.org/abs/2302.06112v1","paper_title":"How to Use Dropout Correctly on Residual Networks with Batch Normalization","code":"https://github.com/kmbmjn/DropoutCorrectly","n_code_links":1,"syntology":null},{"rank_in_archive_order":160,"model":"ABNet-2G-R0","metrics":{"Percentage correct":"73.930"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":161,"model":"Fractional MP","metrics":{"Percentage correct":"73.6"},"uses_additional_data":true,"paper_date":"2014-12-18","paper":"/paper/fractional-max-pooling","paper_url":"http://arxiv.org/abs/1412.6071v4","paper_title":"Fractional Max-Pooling","code":"https://github.com/facebookresearch/SparseConvNet","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":162,"model":"ResNet+ELU","metrics":{"Percentage correct":"73.5"},"uses_additional_data":false,"paper_date":"2016-04-14","paper":"/paper/deep-residual-networks-with-exponential","paper_url":"http://arxiv.org/abs/1604.04112v4","paper_title":"Deep Residual Networks with Exponential Linear Unit","code":"https://github.com/Amihaeseisergiu/Cifar-10-ResNet-ELU-Cutout","n_code_links":1,"syntology":null},{"rank_in_archive_order":163,"model":"PDO-eConv (p6m,0.37M)","metrics":{"Percentage correct":"73"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":164,"model":"SOPCNN","metrics":{"PARAMS":"4,252,298","Percentage correct":"72.96"},"uses_additional_data":true,"paper_date":"2020-01-24","paper":"/paper/stochastic-optimization-of-plain","paper_url":"https://arxiv.org/abs/2001.08856v1","paper_title":"Stochastic Optimization of Plain Convolutional Neural Networks with Simple methods","code":"https://github.com/junaidaliop/MNIST-SOPCNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":165,"model":"PDO-eConv (p6,0.36M)","metrics":{"Percentage correct":"72.87"},"uses_additional_data":true,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":166,"model":"Tuned CNN","metrics":{"Percentage correct":"72.6"},"uses_additional_data":true,"paper_date":"2015-02-19","paper":"/paper/scalable-bayesian-optimization-using-deep","paper_url":"http://arxiv.org/abs/1502.05700v2","paper_title":"Scalable Bayesian Optimization Using Deep Neural Networks","code":"https://github.com/automl/pybnn","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":167,"model":"ResNet-110 (SAP)","metrics":{"Percentage correct":"72.537"},"uses_additional_data":false,"paper_date":"2024-09-25","paper":"/paper/stochastic-subsampling-with-average-pooling","paper_url":"https://arxiv.org/abs/2409.16630v1","paper_title":"Stochastic Subsampling With Average Pooling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":168,"model":"CMsC","metrics":{"Percentage correct":"72.4"},"uses_additional_data":true,"paper_date":"2015-11-18","paper":"/paper/competitive-multi-scale-convolution","paper_url":"http://arxiv.org/abs/1511.05635v1","paper_title":"Competitive Multi-scale Convolution","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":169,"model":"Fitnet4-LSUV","metrics":{"Percentage correct":"72.3"},"uses_additional_data":true,"paper_date":"2015-11-19","paper":"/paper/all-you-need-is-a-good-init","paper_url":"http://arxiv.org/abs/1511.06422v7","paper_title":"All you need is a good init","code":"https://github.com/ducha-aiki/LSUVinit","n_code_links":11,"syntology":{"n_ran":0,"n_unverified":19,"n_samples":19,"n_pointer_only_licence":2}},{"rank_in_archive_order":170,"model":"GAN+ResNet","metrics":{"Percentage correct":"71.52"},"uses_additional_data":false,"paper_date":"2024-12-09","paper":"/paper/how-transfer-learning-is-used-in-generative","paper_url":"https://link.springer.com/article/10.1007/s11760-024-03673-5","paper_title":"How transfer learning is used in generative models for image classification: improved accuracy","code":"https://github.com/DanialEbrahimzadeh/cifar100_gan","n_code_links":1,"syntology":null},{"rank_in_archive_order":171,"model":"kMobileNet V3 Large 16ch","metrics":{"PARAMS":"0.52M","Percentage correct":"71.36"},"uses_additional_data":true,"paper_date":"2022-06-30","paper":"/paper/grouped-pointwise-convolutions-reduce","paper_url":"https://www.researchgate.net/publication/360226228_Grouped_Pointwise_Convolutions_Reduce_Parameters_in_Convolutional_Neural_Networks","paper_title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":172,"model":"BNM NiN","metrics":{"Percentage correct":"71.1"},"uses_additional_data":true,"paper_date":"2015-11-09","paper":"/paper/batch-normalized-maxout-network-in-network","paper_url":"http://arxiv.org/abs/1511.02583v1","paper_title":"Batch-normalized Maxout Network in Network","code":"https://github.com/JohnBensen1000/machine_learning","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":173,"model":"OTTT","metrics":{"Percentage correct":"71.05"},"uses_additional_data":false,"paper_date":"2022-10-09","paper":"/paper/online-training-through-time-for-spiking","paper_url":"https://arxiv.org/abs/2210.04195v2","paper_title":"Online Training Through Time for Spiking Neural Networks","code":"https://github.com/pkuxmq/ottt-snn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":174,"model":"MIM","metrics":{"Percentage correct":"70.8"},"uses_additional_data":true,"paper_date":"2015-08-03","paper":"/paper/on-the-importance-of-normalisation-layers-in","paper_url":"http://arxiv.org/abs/1508.00330v2","paper_title":"On the Importance of Normalisation Layers in Deep Learning with Piecewise Linear Activation Units","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":175,"model":"WaveMix-Lite-256/7","metrics":{"Percentage correct":"70.20"},"uses_additional_data":false,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":176,"model":"IM-Loss (VGG-16)","metrics":{"Percentage correct":"70.18"},"uses_additional_data":false,"paper_date":"2022-10-31","paper":"/paper/im-loss-information-maximization-loss-for","paper_url":"https://openreview.net/forum?id=Jw34v_84m2b","paper_title":"IM-Loss: Information Maximization Loss for Spiking Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":177,"model":"NiN+APL","metrics":{"Percentage correct":"69.2"},"uses_additional_data":true,"paper_date":"2014-12-21","paper":"/paper/learning-activation-functions-to-improve-deep","paper_url":"http://arxiv.org/abs/1412.6830v3","paper_title":"Learning Activation Functions to Improve Deep Neural Networks","code":"https://github.com/ForestAgostinelli/Learned-Activation-Functions-Source","n_code_links":3,"syntology":null},{"rank_in_archive_order":178,"model":"SWWAE","metrics":{"Percentage correct":"69.1"},"uses_additional_data":true,"paper_date":"2015-06-08","paper":"/paper/stacked-what-where-auto-encoders","paper_url":"http://arxiv.org/abs/1506.02351v8","paper_title":"Stacked What-Where Auto-encoders","code":"https://github.com/isaacgerg/keras_odds_and_ends","n_code_links":2,"syntology":null},{"rank_in_archive_order":179,"model":"NiN+Superclass+CDJ","metrics":{"Percentage correct":"69"},"uses_additional_data":true,"paper_date":"2017-06-06","paper":"/paper/deep-convolutional-decision-jungle-for-image","paper_url":"http://arxiv.org/abs/1706.02003v2","paper_title":"Deep Convolutional Decision Jungle for Image Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":180,"model":"Spectral Representations for Convolutional Neural Networks","metrics":{"Percentage correct":"68.4"},"uses_additional_data":false,"paper_date":"2015-06-11","paper":"/paper/spectral-representations-for-convolutional","paper_url":"http://arxiv.org/abs/1506.03767v1","paper_title":"Spectral Representations for Convolutional Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":181,"model":"ReActNet-18","metrics":{"Percentage correct":"68.34"},"uses_additional_data":false,"paper_date":"2021-04-16","paper":"/paper/bnn-bn-training-binary-neural-networks","paper_url":"https://arxiv.org/abs/2104.08215v1","paper_title":"\"BNN - BN = ?\": Training Binary Neural Networks without Batch Normalization","code":"https://github.com/VITA-Group/BNN_NoBN","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":7,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":182,"model":"VDN","metrics":{"Percentage correct":"67.8"},"uses_additional_data":false,"paper_date":"2015-07-22","paper":"/paper/training-very-deep-networks","paper_url":"http://arxiv.org/abs/1507.06228v2","paper_title":"Training Very Deep Networks","code":"https://github.com/LiyuanLucasLiu/LM-LSTM-CRF","n_code_links":3,"syntology":null},{"rank_in_archive_order":183,"model":"DCNN+GFE","metrics":{"Percentage correct":"67.7"},"uses_additional_data":false,"paper_date":"2017-10-06","paper":"/paper/deep-convolutional-neural-networks-as-generic","paper_url":"http://arxiv.org/abs/1710.02286v1","paper_title":"Deep Convolutional Neural Networks as Generic Feature Extractors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":184,"model":"Tree+Max-Avg pooling","metrics":{"Percentage correct":"67.6"},"uses_additional_data":false,"paper_date":"2015-09-30","paper":"/paper/generalizing-pooling-functions-in","paper_url":"http://arxiv.org/abs/1509.08985v2","paper_title":"Generalizing Pooling Functions in Convolutional Neural Networks: Mixed, Gated, and Tree","code":"https://github.com/cypw/DPNs","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":11,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":185,"model":"HD-CNN","metrics":{"Percentage correct":"67.4"},"uses_additional_data":false,"paper_date":"2014-10-03","paper":"/paper/hd-cnn-hierarchical-deep-convolutional-neural","paper_url":"http://arxiv.org/abs/1410.0736v4","paper_title":"HD-CNN: Hierarchical Deep Convolutional Neural Network for Large Scale Visual Recognition","code":"https://github.com/justinessert/hierarchical-deep-cnn","n_code_links":4,"syntology":null},{"rank_in_archive_order":186,"model":"Universum Prescription","metrics":{"Percentage correct":"67.2"},"uses_additional_data":false,"paper_date":"2015-11-11","paper":"/paper/universum-prescription-regularization-using","paper_url":"http://arxiv.org/abs/1511.03719v7","paper_title":"Universum Prescription: Regularization using Unlabeled Data","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":187,"model":"ResNet50 Without Transfer Learning","metrics":{"Percentage correct":"67.060"},"uses_additional_data":false,"paper_date":"2020-08-03","paper":"/paper/resnet50-on-cifar-100-without-transfer","paper_url":"https://github.com/batuhan3526/ResNet50_on_Cifar_100_Without_Transfer_Learning/blob/master/abstract.txt","paper_title":"ResNet50_on_Cifar_100_Without_Transfer_Learning","code":"https://github.com/batuhan3526/ResNet50_on_Cifar_100_Without_Transfer_Learning","n_code_links":6,"syntology":null},{"rank_in_archive_order":188,"model":"AlexNet (KP)","metrics":{"Percentage correct":"66.78"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/learning-the-connections-in-direct-feedback","paper_url":"https://openreview.net/forum?id=zgGmAx9ZcY","paper_title":"Learning the Connections in Direct Feedback Alignment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":189,"model":"ACN","metrics":{"Percentage correct":"66.3"},"uses_additional_data":false,"paper_date":"2014-12-21","paper":"/paper/striving-for-simplicity-the-all-convolutional","paper_url":"http://arxiv.org/abs/1412.6806v3","paper_title":"Striving for Simplicity: The All Convolutional Net","code":"https://github.com/pytorch/captum","n_code_links":37,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":190,"model":"DLME (ResNet-18, linear)","metrics":{"Percentage correct":"66.1"},"uses_additional_data":false,"paper_date":"2022-07-07","paper":"/paper/dlme-deep-local-flatness-manifold-embedding","paper_url":"https://arxiv.org/abs/2207.03160v2","paper_title":"DLME: Deep Local-flatness Manifold Embedding","code":"https://github.com/Westlake-AI/openmixup","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":191,"model":"ResNet-18 (modified)","metrics":{"Percentage correct":"66"},"uses_additional_data":false,"paper_date":"2022-10-30","paper":"/paper/fatnet-high-resolution-kernels-for","paper_url":"https://arxiv.org/abs/2210.16914v1","paper_title":"FatNet: High Resolution Kernels for Classification Using Fully Convolutional Optical Neural Networks","code":"https://github.com/riadibadulla/simulator","n_code_links":1,"syntology":null},{"rank_in_archive_order":192,"model":"DSN","metrics":{"Percentage correct":"65.4"},"uses_additional_data":false,"paper_date":"2014-09-18","paper":"/paper/deeply-supervised-nets","paper_url":"http://arxiv.org/abs/1409.5185v2","paper_title":"Deeply-Supervised Nets","code":"https://github.com/ellisdg/3DUnetCNN","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":21,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":193,"model":"NiN","metrics":{"Percentage correct":"64.3"},"uses_additional_data":false,"paper_date":"2013-12-16","paper":"/paper/network-in-network","paper_url":"http://arxiv.org/abs/1312.4400v3","paper_title":"Network In Network","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Network_In_Network","n_code_links":17,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":194,"model":"Tree Priors","metrics":{"Percentage correct":"63.2"},"uses_additional_data":false,"paper_date":"2013-12-01","paper":"/paper/discriminative-transfer-learning-with-tree","paper_url":"http://papers.nips.cc/paper/5029-discriminative-transfer-learning-with-tree-based-priors","paper_title":"Discriminative Transfer Learning with Tree-based Priors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":195,"model":"DNN+Probabilistic Maxout","metrics":{"Percentage correct":"61.9"},"uses_additional_data":false,"paper_date":"2013-12-20","paper":"/paper/improving-deep-neural-networks-with","paper_url":"http://arxiv.org/abs/1312.6116v2","paper_title":"Improving Deep Neural Networks with Probabilistic Maxout Units","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":196,"model":"Maxout Network (k=2)","metrics":{"Percentage correct":"61.43"},"uses_additional_data":false,"paper_date":"2013-02-18","paper":"/paper/maxout-networks","paper_url":"http://arxiv.org/abs/1302.4389v4","paper_title":"Maxout Networks","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Maxout_Networks","n_code_links":7,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":197,"model":"ResNet20+UnsharpMaskLayer","metrics":{"Percentage correct":"60.36"},"uses_additional_data":false,"paper_date":"2019-09-29","paper":"/paper/unsharp-masking-layer-injecting-prior","paper_url":"https://doi.org/10.1007/978-3-030-30508-6_1","paper_title":"Unsharp Masking Layer: Injecting Prior Knowledge in Convolutional Networks for Image Classification","code":"https://github.com/maeotaku/pytorch_usm","n_code_links":1,"syntology":null},{"rank_in_archive_order":198,"model":"Convolutional Linear Transformer for Vision (CLTV)","metrics":{"Percentage correct":"60.11"},"uses_additional_data":false,"paper_date":"2022-01-25","paper":"/paper/convolutional-xformers-for-vision","paper_url":"https://arxiv.org/abs/2201.10271v1","paper_title":"Convolutional Xformers for Vision","code":"https://github.com/pranavphoenix/cxv","n_code_links":1,"syntology":null},{"rank_in_archive_order":199,"model":"FatNet of ResNet-18","metrics":{"Percentage correct":"60"},"uses_additional_data":false,"paper_date":"2022-10-30","paper":"/paper/fatnet-high-resolution-kernels-for","paper_url":"https://arxiv.org/abs/2210.16914v1","paper_title":"FatNet: High Resolution Kernels for Classification Using Fully Convolutional Optical Neural Networks","code":"https://github.com/riadibadulla/simulator","n_code_links":1,"syntology":null},{"rank_in_archive_order":200,"model":"Optical Simulation of FatNet","metrics":{"Percentage correct":"60"},"uses_additional_data":false,"paper_date":"2022-10-30","paper":"/paper/fatnet-high-resolution-kernels-for","paper_url":"https://arxiv.org/abs/2210.16914v1","paper_title":"FatNet: High Resolution Kernels for Classification Using Fully Convolutional Optical Neural Networks","code":"https://github.com/riadibadulla/simulator","n_code_links":1,"syntology":null},{"rank_in_archive_order":201,"model":"RReLU","metrics":{"Percentage correct":"59.8"},"uses_additional_data":false,"paper_date":"2015-05-05","paper":"/paper/empirical-evaluation-of-rectified-activations","paper_url":"http://arxiv.org/abs/1505.00853v2","paper_title":"Empirical Evaluation of Rectified Activations in Convolutional Network","code":"https://github.com/OsvaldN/APS360_Project","n_code_links":2,"syntology":null},{"rank_in_archive_order":202,"model":"Stochastic Pooling","metrics":{"Percentage correct":"57.5"},"uses_additional_data":false,"paper_date":"2013-01-16","paper":"/paper/stochastic-pooling-for-regularization-of-deep","paper_url":"http://arxiv.org/abs/1301.3557v1","paper_title":"Stochastic Pooling for Regularization of Deep Convolutional Neural Networks","code":"https://github.com/szagoruyko/imagine-nn","n_code_links":1,"syntology":null},{"rank_in_archive_order":203,"model":"Sign-symmetry","metrics":{"Percentage correct":"48.75"},"uses_additional_data":false,"paper_date":"2015-10-17","paper":"/paper/how-important-is-weight-symmetry-in","paper_url":"http://arxiv.org/abs/1510.05067v4","paper_title":"How Important is Weight Symmetry in Backpropagation?","code":"https://github.com/jsalbert/biotorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":204,"model":"AlexNet (DFA)","metrics":{"Percentage correct":"48.03"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/learning-the-connections-in-direct-feedback","paper_url":"https://openreview.net/forum?id=zgGmAx9ZcY","paper_title":"Learning the Connections in Direct Feedback Alignment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":205,"model":"CNN39","metrics":{"Percentage correct":"42.64"},"uses_additional_data":false,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":206,"model":"CNN36","metrics":{"Percentage correct":"36.07"},"uses_additional_data":false,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":207,"model":"CNN37","metrics":{"Percentage correct":"35.05"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/sharpness-aware-quantization-for-deep-neural","paper_url":"https://arxiv.org/abs/2111.12273v5","paper_title":"Sharpness-aware Quantization for Deep Neural Networks","code":"https://github.com/ziplab/saq","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":208,"model":"AlexNet (FA)","metrics":{"Percentage correct":"19.49"},"uses_additional_data":false,"paper_date":"2021-01-01","paper":"/paper/learning-the-connections-in-direct-feedback","paper_url":"https://openreview.net/forum?id=zgGmAx9ZcY","paper_title":"Learning the Connections in Direct Feedback Alignment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":209,"model":"efficient adaptive ensembling","metrics":{"Accuracy":"96.808"},"uses_additional_data":true,"paper_date":"2022-06-15","paper":"/paper/efficient-adaptive-ensembling-for-image","paper_url":"https://arxiv.org/abs/2206.07394v3","paper_title":"Efficient Adaptive Ensembling for Image Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":210,"model":"Label-Ranker","metrics":{"Accuracy":"90.82%"},"uses_additional_data":false,"paper_date":"2025-03-03","paper":"/paper/label-ranker-self-aware-preference-for","paper_url":"https://www.preprints.org/manuscript/202503.0003/v1","paper_title":"Label Ranker: Self-Aware Preference for Classification Label Position in Visual Masked Self-Supervised Pre-Trained Model","code":"https://github.com/Peihao-Xiang/Label-Ranker","n_code_links":1,"syntology":null},{"rank_in_archive_order":211,"model":"DGMMC-S","metrics":{"Top 1 Accuracy":"91.2"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/performance-of-gaussian-mixture-model","paper_url":"https://arxiv.org/abs/2410.13421v1","paper_title":"Performance of Gaussian Mixture Model Classifiers on Embedded Feature Spaces","code":"https://github.com/cvmlmu/dgmmc","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 7,081 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":7081,"papers_extracted_not_yet_verified":217,"boards_without_verdict":27,"papers_not_yet_extracted":2325},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":107,"rows_with_any_sample_ran":87,"distinct_papers_with_graph_line":75,"distinct_papers_with_any_sample_ran":62,"samples_over_distinct_papers":{"n_ran":714,"n_unverified":612,"n_samples":1326,"n_pointer_only_licence":359,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":937,"n_unverified":814,"n_samples":1751,"n_pointer_only_licence":426,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}