{"url":"/sota/image-classification-on-cifar-10","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"CIFAR-10","url":"/dataset/cifar-10"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Percentage correct","Top-1 Accuracy","Accuracy","Parameters","Top 1 Accuracy","F1","Cross Entropy Loss"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Percentage correct":null,"Top-1 Accuracy":"higher","Accuracy":"higher","Parameters":null,"Top 1 Accuracy":"higher","F1":"higher","Cross Entropy Loss":"lower"}},"counts":{"rows":265,"rows_with_code":230,"rows_with_paper_page":263,"rows_dated":263,"rows_using_additional_data":43},"rows":[{"rank_in_archive_order":1,"model":"ViT-H/14","metrics":{"Percentage correct":"99.5"},"uses_additional_data":true,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":307,"n_unverified":112,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":2,"model":"DINOv2 (ViT-g/14, frozen model, linear eval)","metrics":{"Percentage correct":"99.5"},"uses_additional_data":true,"paper_date":"2023-04-14","paper":"/paper/dinov2-learning-robust-visual-features","paper_url":"https://arxiv.org/abs/2304.07193v2","paper_title":"DINOv2: Learning Robust Visual Features without Supervision","code":"https://github.com/huggingface/transformers","n_code_links":26,"syntology":{"n_ran":36,"n_unverified":10,"n_samples":46,"n_pointer_only_licence":12}},{"rank_in_archive_order":3,"model":"µ2Net (ViT-L/16)","metrics":{"Percentage correct":"99.49"},"uses_additional_data":true,"paper_date":"2022-05-25","paper":"/paper/an-evolutionary-approach-to-dynamic","paper_url":"https://arxiv.org/abs/2205.12755v6","paper_title":"An Evolutionary Approach to Dynamic Introduction of Tasks in Large-scale Multitask Learning Systems","code":"https://github.com/google-research/google-research/tree/master/muNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":4,"model":"ViT-L/16","metrics":{"Percentage correct":"99.42"},"uses_additional_data":true,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":307,"n_unverified":112,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":5,"model":"CaiT-M-36 U 224","metrics":{"Percentage correct":"99.4"},"uses_additional_data":true,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":6,"model":"CvT-W24","metrics":{"Percentage correct":"99.39"},"uses_additional_data":true,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":38,"n_unverified":9,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":7,"model":"BiT-L (ResNet)","metrics":{"Percentage correct":"99.37"},"uses_additional_data":true,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"RDNet-L (224 res, IN-1K pretrained)","metrics":{"Percentage correct":"99.31"},"uses_additional_data":true,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":9,"model":"RDNet-B (224 res, IN-1K pretrained)","metrics":{"Percentage correct":"99.31"},"uses_additional_data":true,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":10,"model":"ViT-B (attn fine-tune)","metrics":{"Percentage correct":"99.3"},"uses_additional_data":true,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"Heinsen Routing + BEiT-large 16 224","metrics":{"Percentage correct":"99.2"},"uses_additional_data":true,"paper_date":"2022-11-20","paper":"/paper/an-algorithm-for-routing-vectors-in-sequences","paper_url":"https://arxiv.org/abs/2211.11754v3","paper_title":"An Algorithm for Routing Vectors in Sequences","code":"https://github.com/glassroom/heinsen_routing","n_code_links":1,"syntology":null},{"rank_in_archive_order":12,"model":"ViT-B/16 (PUGD)","metrics":{"Percentage correct":"99.13"},"uses_additional_data":true,"paper_date":"2021-10-01","paper":"/paper/update-in-unit-gradient","paper_url":"https://arxiv.org/abs/2110.00199v2","paper_title":"Perturbated Gradients Updating within Unit Space for Deep Learning","code":"https://github.com/hanktseng131415go/pugd","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"Astroformer","metrics":{"Percentage correct":"99.12","Top-1 Accuracy":"99.12"},"uses_additional_data":true,"paper_date":"2023-04-03","paper":"/paper/astroformer-more-data-might-not-be-all-you","paper_url":"https://arxiv.org/abs/2304.05350v2","paper_title":"Astroformer: More Data Might not be all you need for Classification","code":"https://github.com/Rishit-dagli/Astroformer","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"DeiT-B","metrics":{"Percentage correct":"99.1"},"uses_additional_data":true,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":15,"model":"TNT-B","metrics":{"Percentage correct":"99.1"},"uses_additional_data":true,"paper_date":"2021-02-27","paper":"/paper/transformer-in-transformer","paper_url":"https://arxiv.org/abs/2103.00112v3","paper_title":"Transformer in Transformer","code":"https://github.com/rwightman/pytorch-image-models/blob/master/timm/models/tnt.py","n_code_links":12,"syntology":{"n_ran":16,"n_unverified":8,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":16,"model":"CeiT-S (384 finetune resolution)","metrics":{"Percentage correct":"99.1"},"uses_additional_data":true,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"EfficientNetV2-L","metrics":{"Percentage correct":"99.1"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":18,"model":"AutoFormer-S | 384","metrics":{"Percentage correct":"99.1"},"uses_additional_data":true,"paper_date":"2021-07-01","paper":"/paper/autoformer-searching-transformers-for-visual","paper_url":"https://arxiv.org/abs/2107.00651v1","paper_title":"AutoFormer: Searching Transformers for Visual Recognition","code":"https://github.com/microsoft/AutoML","n_code_links":2,"syntology":null},{"rank_in_archive_order":19,"model":"VIT-L/16 (Spinal FC, Background)","metrics":{"Percentage correct":"99.05"},"uses_additional_data":false,"paper_date":"2023-05-05","paper":"/paper/reduction-of-class-activation-uncertainty","paper_url":"https://arxiv.org/abs/2305.03238v6","paper_title":"Reduction of Class Activation Uncertainty with Background Information","code":"https://github.com/dipuk0506/SpinalNet","n_code_links":2,"syntology":null},{"rank_in_archive_order":20,"model":"LaNet","metrics":{"Percentage correct":"99.03"},"uses_additional_data":false,"paper_date":"2019-01-01","paper":"/paper/sample-efficient-neural-architecture-search-1","paper_url":"https://linnanwang.github.io/latent-actions.pdf","paper_title":"Sample-Efficient Neural Architecture Search by Learning Action Space for Monte Carlo Tree Search","code":"https://github.com/facebookresearch/LaMCTS","n_code_links":1,"syntology":null},{"rank_in_archive_order":21,"model":"GPIPE + transfer learning","metrics":{"Percentage correct":"99"},"uses_additional_data":true,"paper_date":"2018-11-16","paper":"/paper/gpipe-efficient-training-of-giant-neural","paper_url":"https://arxiv.org/abs/1811.06965v5","paper_title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","code":"https://github.com/tensorflow/lingvo","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":24,"n_samples":25,"n_pointer_only_licence":16}},{"rank_in_archive_order":22,"model":"TResNet-XL","metrics":{"Percentage correct":"99"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/tresnet-high-performance-gpu-dedicated","paper_url":"https://arxiv.org/abs/2003.13630v3","paper_title":"TResNet: High Performance GPU-Dedicated Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":23,"model":"CeiT-S","metrics":{"Percentage correct":"99"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":24,"model":"EfficientNetV2-M","metrics":{"Percentage correct":"99.0"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":25,"model":"GFNet-H-B","metrics":{"Percentage correct":"99.0"},"uses_additional_data":true,"paper_date":"2021-07-01","paper":"/paper/global-filter-networks-for-image","paper_url":"https://arxiv.org/abs/2107.00645v2","paper_title":"Global Filter Networks for Image Classification","code":"https://github.com/raoyongming/GFNet","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":5}},{"rank_in_archive_order":26,"model":"BiT-M (ResNet)","metrics":{"Percentage correct":"98.91"},"uses_additional_data":false,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":9,"n_unverified":1,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":27,"model":"EfficientNet-B7","metrics":{"Percentage correct":"98.9"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":198,"n_unverified":104,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":28,"model":"RDNet-T (224 res, IN-1K pretrained)","metrics":{"Percentage correct":"98.88"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"ASF-former-B","metrics":{"Percentage correct":"98.8%"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/adaptive-split-fusion-transformer","paper_url":"https://arxiv.org/abs/2204.12196v2","paper_title":"Adaptive Split-Fusion Transformer","code":"https://github.com/szx503045266/asf-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":30,"model":"PyramidNet-272, S=4","metrics":{"Percentage correct":"98.71"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":31,"model":"EfficientNetV2-S","metrics":{"Percentage correct":"98.7"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":52,"n_unverified":27,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":32,"model":"ASF-former-S","metrics":{"Percentage correct":"98.7"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/adaptive-split-fusion-transformer","paper_url":"https://arxiv.org/abs/2204.12196v2","paper_title":"Adaptive Split-Fusion Transformer","code":"https://github.com/szx503045266/asf-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":33,"model":"PyramidNet-272 (ASAM)","metrics":{"Percentage correct":"98.68"},"uses_additional_data":false,"paper_date":"2021-02-23","paper":"/paper/asam-adaptive-sharpness-aware-minimization","paper_url":"https://arxiv.org/abs/2102.11600v3","paper_title":"ASAM: Adaptive Sharpness-Aware Minimization for Scale-Invariant Learning of Deep Neural Networks","code":"https://github.com/davda54/sam","n_code_links":2,"syntology":null},{"rank_in_archive_order":34,"model":"PyramidNet + ShakeDrop + Fast AA + FMix","metrics":{"Percentage correct":"98.64"},"uses_additional_data":false,"paper_date":"2020-02-27","paper":"/paper/understanding-and-enhancing-mixed-sample-data","paper_url":"https://arxiv.org/abs/2002.12047v3","paper_title":"FMix: Enhancing Mixed Sample Data Augmentation","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":5,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":3}},{"rank_in_archive_order":35,"model":"ViT-B/16- SAM","metrics":{"Percentage correct":"98.6"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":36,"model":"ConvMLP-M","metrics":{"Percentage correct":"98.6"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":37,"model":"ConvMLP-L","metrics":{"Percentage correct":"98.6"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"DVT (T2T-ViT-24)","metrics":{"Percentage correct":"98.53"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/not-all-images-are-worth-16x16-words-dynamic","paper_url":"https://arxiv.org/abs/2105.15075v2","paper_title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","code":"https://github.com/blackfeather-wang/Dynamic-Vision-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":39,"model":"E2E-3M","metrics":{"Percentage correct":"98.52"},"uses_additional_data":false,"paper_date":"2020-07-30","paper":"/paper/rethinking-recurrent-neural-networks-and","paper_url":"https://arxiv.org/abs/2007.15161v3","paper_title":"Rethinking Recurrent Neural Networks and Other Improvements for Image Classification","code":"https://github.com/leonlha/e2e-3m","n_code_links":1,"syntology":null},{"rank_in_archive_order":40,"model":"CeiT-T","metrics":{"Percentage correct":"98.5"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":41,"model":"NAT-M4","metrics":{"Parameters":"6.9M","Percentage correct":"98.4","Top-1 Accuracy":"98.4"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":42,"model":"WRN-40-10, S=4","metrics":{"Percentage correct":"98.38"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":43,"model":"WRN-28-10, S=4","metrics":{"Percentage correct":"98.32"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":44,"model":"Shake-Shake 26 2x96d, S=4","metrics":{"Percentage correct":"98.31"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":45,"model":"Dynamics 2","metrics":{"Percentage correct":"98.31"},"uses_additional_data":false,"paper_date":"2022-05-20","paper":"/paper/pso-convolutional-neural-networks-with","paper_url":"https://arxiv.org/abs/2205.10456v3","paper_title":"PSO-Convolutional Neural Networks with Heterogeneous Learning Rate","code":"https://github.com/leonlha/pso-convnet-dynamics","n_code_links":1,"syntology":null},{"rank_in_archive_order":46,"model":"PyramidNet+ShakeDrop (Fast AA)","metrics":{"Percentage correct":"98.3"},"uses_additional_data":false,"paper_date":"2019-05-01","paper":"/paper/fast-autoaugment","paper_url":"https://arxiv.org/abs/1905.00397v2","paper_title":"Fast AutoAugment","code":"https://github.com/kakaobrain/fast-autoaugment","n_code_links":11,"syntology":{"n_ran":32,"n_unverified":8,"n_samples":40,"n_pointer_only_licence":3}},{"rank_in_archive_order":47,"model":"ResNet50 (A1)","metrics":{"Percentage correct":"98.3"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":48,"model":"NoisyDARTS-A-t","metrics":{"Percentage correct":"98.28"},"uses_additional_data":false,"paper_date":"2020-05-07","paper":"/paper/noisy-differentiable-architecture-search","paper_url":"https://arxiv.org/abs/2005.03566v3","paper_title":"Noisy Differentiable Architecture Search","code":"https://github.com/xiaomi-automl/NoisyDARTS","n_code_links":1,"syntology":null},{"rank_in_archive_order":49,"model":"NAT-M3","metrics":{"Parameters":"6.2M","Percentage correct":"98.2","Top-1 Accuracy":"98.2"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":50,"model":"LeViT-192","metrics":{"Percentage correct":"98.2"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"ResNet-152-SAM","metrics":{"Percentage correct":"98.2"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":52,"model":"ViT-S/16- SAM","metrics":{"Percentage correct":"98.2"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":53,"model":"Bamboo (ViT-B/16)","metrics":{"Percentage correct":"98.2"},"uses_additional_data":false,"paper_date":"2022-03-15","paper":"/paper/bamboo-building-mega-scale-vision-dataset","paper_url":"https://arxiv.org/abs/2203.07845v2","paper_title":"Bamboo: Building Mega-Scale Vision Dataset Continually with Human-Machine Synergy","code":"https://github.com/zhangyuanhan-ai/bamboo","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":54,"model":"DE ELBo (ViT-B/16)","metrics":{"Percentage correct":"98.2"},"uses_additional_data":false,"paper_date":"2025-02-03","paper":"/paper/learning-hyperparameters-via-a-data","paper_url":"https://arxiv.org/abs/2502.01861v1","paper_title":"Learning Hyperparameters via a Data-Emphasized Variational Objective","code":"https://github.com/tufts-ml/data-emphasized-ELBo","n_code_links":1,"syntology":null},{"rank_in_archive_order":55,"model":"LeViT-256","metrics":{"Percentage correct":"98.1"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":56,"model":"PyramidNet + AA (AMP)","metrics":{"Percentage correct":"98.02"},"uses_additional_data":false,"paper_date":"2020-10-10","paper":"/paper/regularizing-neural-networks-via-adversarial","paper_url":"https://arxiv.org/abs/2010.04925v4","paper_title":"Regularizing Neural Networks via Adversarial Model Perturbation","code":"https://github.com/hiyouga/AMP-Regularizer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":57,"model":"EnAET","metrics":{"Percentage correct":"98.01"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/enaet-self-trained-ensemble-autoencoding","paper_url":"https://arxiv.org/abs/1911.09265v2","paper_title":"EnAET: A Self-Trained framework for Semi-Supervised and Supervised Learning with Ensemble Transformations","code":"https://github.com/maple-research-lab/EnAET","n_code_links":2,"syntology":null},{"rank_in_archive_order":58,"model":"MUXNet-m","metrics":{"Percentage correct":"98.0","Top-1 Accuracy":"98.0"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":59,"model":"LeViT-384","metrics":{"Percentage correct":"98"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"CCT-7/3x1*","metrics":{"Percentage correct":"98"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":61,"model":"ConvMLP-S","metrics":{"Percentage correct":"98"},"uses_additional_data":true,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"Proxyless-G + c/o","metrics":{"Percentage correct":"97.92"},"uses_additional_data":false,"paper_date":"2018-12-02","paper":"/paper/proxylessnas-direct-neural-architecture","paper_url":"http://arxiv.org/abs/1812.00332v2","paper_title":"ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware","code":"https://github.com/osmr/imgclsmob","n_code_links":23,"syntology":{"n_ran":9,"n_unverified":18,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":63,"model":"NAT-M2","metrics":{"Parameters":"4.6M","Percentage correct":"97.9","Top-1 Accuracy":"97.9"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":64,"model":"WRN-28-10+AutoDropout+RandAugment","metrics":{"Percentage correct":"97.9"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":65,"model":"SENet + ShakeShake + Cutout","metrics":{"Percentage correct":"97.88"},"uses_additional_data":false,"paper_date":"2017-09-05","paper":"/paper/squeeze-and-excitation-networks","paper_url":"https://arxiv.org/abs/1709.01507v4","paper_title":"Squeeze-and-Excitation Networks","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":85,"syntology":{"n_ran":2,"n_unverified":7,"n_samples":9,"n_pointer_only_licence":6}},{"rank_in_archive_order":66,"model":"HCGNet-A3","metrics":{"Percentage correct":"97.86"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":67,"model":"Wide-ResNet-28-10","metrics":{"Percentage correct":"97.85"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/automatic-data-augmentation-via-invariance","paper_url":"https://arxiv.org/abs/2209.15031v2","paper_title":"Automatic Data Augmentation via Invariance-Constrained Learning","code":"https://github.com/ihounie/daug","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"ResNeXt-50 (AutoMix)","metrics":{"Percentage correct":"97.84"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"ResNet-152x4-AGC (ImageNet-21K)","metrics":{"Percentage correct":"97.82"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/effect-of-large-scale-pre-training-on-full","paper_url":"https://arxiv.org/abs/2106.00116v4","paper_title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","code":"https://github.com/SLAMPAI/large-scale-pretraining-transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":70,"model":"Mixer-B/16- SAM","metrics":{"Percentage correct":"97.8"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":71,"model":"CCT-7/3x1+VTM","metrics":{"Percentage correct":"97.78"},"uses_additional_data":false,"paper_date":"2022-10-14","paper":"/paper/tokenmixup-efficient-attention-guided-token","paper_url":"https://arxiv.org/abs/2210.07562v1","paper_title":"TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers","code":"https://github.com/mlvlab/tokenmixup","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"WRN-28-10","metrics":{"Percentage correct":"97.73"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/mixmo-mixing-multiple-inputs-for-multiple","paper_url":"https://arxiv.org/abs/2103.06132v3","paper_title":"MixMo: Mixing Multiple Inputs for Multiple Outputs via Deep Subnetworks","code":"https://github.com/alexrame/mixmo-pytorch","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":73,"model":"HCGNet-A2","metrics":{"Percentage correct":"97.71"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":74,"model":"WRN + fixup init + mixup + cutout","metrics":{"Percentage correct":"97.7"},"uses_additional_data":false,"paper_date":"2019-01-27","paper":"/paper/fixup-initialization-residual-learning","paper_url":"http://arxiv.org/abs/1901.09321v2","paper_title":"Fixup Initialization: Residual Learning Without Normalization","code":"https://github.com/hongyi-zhang/Fixup","n_code_links":10,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":75,"model":"NoisyDARTS-a","metrics":{"Percentage correct":"97.61"},"uses_additional_data":false,"paper_date":"2020-05-07","paper":"/paper/noisy-differentiable-architecture-search","paper_url":"https://arxiv.org/abs/2005.03566v3","paper_title":"Noisy Differentiable Architecture Search","code":"https://github.com/xiaomi-automl/NoisyDARTS","n_code_links":1,"syntology":null},{"rank_in_archive_order":76,"model":"TransBoost-ResNet50","metrics":{"Percentage correct":"97.61"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":77,"model":"LeViT-128","metrics":{"Percentage correct":"97.6"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"DenseNet-BC-190 + batchboost","metrics":{"Percentage correct":"97.54"},"uses_additional_data":false,"paper_date":"2020-01-21","paper":"/paper/batchboost-regularization-for-stabilizing","paper_url":"https://arxiv.org/abs/2001.07627v1","paper_title":"batchboost: regularization for stabilizing training with resistance to underfitting & overfitting","code":"https://github.com/maciejczyzewski/batchboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":79,"model":"LeViT-128S","metrics":{"Percentage correct":"97.5"},"uses_additional_data":true,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"Shared WRN","metrics":{"Percentage correct":"97.47"},"uses_additional_data":false,"paper_date":"2019-02-26","paper":"/paper/learning-implicitly-recurrent-cnns-through","paper_url":"http://arxiv.org/abs/1902.09701v2","paper_title":"Learning Implicitly Recurrent CNNs Through Parameter Sharing","code":"https://github.com/lolemacs/soft-sharing","n_code_links":1,"syntology":null},{"rank_in_archive_order":81,"model":"Manifold Mixup WRN 28-10","metrics":{"Percentage correct":"97.45"},"uses_additional_data":false,"paper_date":"2018-06-13","paper":"/paper/manifold-mixup-better-representations-by","paper_url":"https://arxiv.org/abs/1806.05236v7","paper_title":"Manifold Mixup: Better Representations by Interpolating Hidden States","code":"https://github.com/Westlake-AI/openmixup","n_code_links":12,"syntology":{"n_ran":2,"n_unverified":9,"n_samples":11,"n_pointer_only_licence":5}},{"rank_in_archive_order":82,"model":"WRN 28-14","metrics":{"Percentage correct":"97.45"},"uses_additional_data":false,"paper_date":"2020-07-25","paper":"/paper/economical-ensembles-with-hypernetworks","paper_url":"https://arxiv.org/abs/2007.12927v4","paper_title":"Neural networks with late-phase weights","code":"https://github.com/google/uncertainty-baselines","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":83,"model":"SparseSwin","metrics":{"Percentage correct":"97.43"},"uses_additional_data":false,"paper_date":"2023-09-11","paper":"/paper/sparseswin-swin-transformer-with-sparse","paper_url":"https://arxiv.org/abs/2309.05224v1","paper_title":"SparseSwin: Swin Transformer with Sparse Transformer Block","code":"https://github.com/krisnapinasthika/sparseswin","n_code_links":1,"syntology":null},{"rank_in_archive_order":84,"model":"WRN-28-10 with reSGHMC","metrics":{"Percentage correct":"97.42"},"uses_additional_data":false,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":85,"model":"NAT-M1","metrics":{"Parameters":"4.3M","Percentage correct":"97.4","Top-1 Accuracy":"97.4"},"uses_additional_data":true,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":86,"model":"ResNet-50-SAM","metrics":{"Percentage correct":"97.4"},"uses_additional_data":true,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":87,"model":"DenseNet-BC-190 + Mixup","metrics":{"Percentage correct":"97.3"},"uses_additional_data":true,"paper_date":"2017-10-25","paper":"/paper/mixup-beyond-empirical-risk-minimization","paper_url":"http://arxiv.org/abs/1710.09412v2","paper_title":"mixup: Beyond Empirical Risk Minimization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":71,"syntology":{"n_ran":32,"n_unverified":15,"n_samples":47,"n_pointer_only_licence":15}},{"rank_in_archive_order":88,"model":"kNN-CLIP","metrics":{"Percentage correct":"97.3"},"uses_additional_data":true,"paper_date":"2022-04-03","paper":"/paper/revisiting-a-knn-based-image-classification","paper_url":"https://arxiv.org/abs/2204.01186v2","paper_title":"Revisiting a kNN-based Image Classification System with High-capacity Storage","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":89,"model":"WaveMixLite-144/7","metrics":{"Percentage correct":"97.29"},"uses_additional_data":false,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":90,"model":"Transformer local-attention (NesT-B)","metrics":{"Percentage correct":"97.2"},"uses_additional_data":false,"paper_date":"2021-05-26","paper":"/paper/aggregating-nested-transformers","paper_url":"https://arxiv.org/abs/2105.12723v4","paper_title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":91,"model":"ShakeShake-2x64d + SWA","metrics":{"Percentage correct":"97.12"},"uses_additional_data":false,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"PyramidNet-200 + CutMix","metrics":{"Percentage correct":"97.12"},"uses_additional_data":false,"paper_date":"2019-05-13","paper":"/paper/cutmix-regularization-strategy-to-train","paper_url":"https://arxiv.org/abs/1905.04899v2","paper_title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":30,"syntology":{"n_ran":17,"n_unverified":7,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":93,"model":"Wide-ResNet-40-2","metrics":{"Percentage correct":"97.05"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/automatic-data-augmentation-via-invariance","paper_url":"https://arxiv.org/abs/2209.15031v2","paper_title":"Automatic Data Augmentation via Invariance-Constrained Learning","code":"https://github.com/ihounie/daug","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"ORN","metrics":{"Percentage correct":"97.02"},"uses_additional_data":false,"paper_date":"2017-01-07","paper":"/paper/oriented-response-networks","paper_url":"http://arxiv.org/abs/1701.01833v2","paper_title":"Oriented Response Networks","code":"https://github.com/ZhouYanzhao/ORN","n_code_links":1,"syntology":null},{"rank_in_archive_order":95,"model":"WRN-16-8 with reSGHMC","metrics":{"Percentage correct":"96.87"},"uses_additional_data":false,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":96,"model":"ResNet_XnIDR","metrics":{"Percentage correct":"96.87"},"uses_additional_data":false,"paper_date":"2021-11-21","paper":"/paper/xnodr-and-xnidr-two-accurate-and-fast-fully","paper_url":"https://arxiv.org/abs/2111.10854v3","paper_title":"XnODR and XnIDR: Two Accurate and Fast Fully Connected Layers For Convolutional Neural Networks","code":"https://github.com/jiansfoggy/CODE-SHOW/tree/master/Python/XnODR_and_XnIDR","n_code_links":1,"syntology":null},{"rank_in_archive_order":97,"model":"HCGNet-A1","metrics":{"Percentage correct":"96.85"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":98,"model":"WRN 28-10","metrics":{"Percentage correct":"96.81"},"uses_additional_data":false,"paper_date":"2020-07-25","paper":"/paper/economical-ensembles-with-hypernetworks","paper_url":"https://arxiv.org/abs/2007.12927v4","paper_title":"Neural networks with late-phase weights","code":"https://github.com/google/uncertainty-baselines","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":99,"model":"AutoDropout","metrics":{"Percentage correct":"96.8"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":100,"model":"WRN-28-10 + SWA","metrics":{"Percentage correct":"96.79"},"uses_additional_data":false,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"ConvMixer-256/16","metrics":{"Percentage correct":"96.74"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/patches-are-all-you-need-1","paper_url":"https://arxiv.org/abs/2201.09792v1","paper_title":"Patches Are All You Need?","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":12,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":102,"model":"EXACT (WRN-28-10)","metrics":{"Percentage correct":"96.73"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/exact-how-to-train-your-accuracy","paper_url":"https://arxiv.org/abs/2205.09615v5","paper_title":"EXACT: How to Train Your Accuracy","code":"https://github.com/tinkoff-ai/exact","n_code_links":2,"syntology":null},{"rank_in_archive_order":103,"model":"Wide ResNet+cutout","metrics":{"Percentage correct":"96.71"},"uses_additional_data":false,"paper_date":"2019-07-16","paper":"/paper/single-bit-per-weight-deep-convolutional","paper_url":"https://arxiv.org/abs/1907.06916v2","paper_title":"Single-bit-per-weight deep convolutional neural networks without batch-normalization layers for embedded systems","code":"https://github.com/McDonnell-Lab/1-bit-per-weight","n_code_links":1,"syntology":null},{"rank_in_archive_order":104,"model":"Deep pyramidal residual network","metrics":{"Percentage correct":"96.69"},"uses_additional_data":false,"paper_date":"2016-10-10","paper":"/paper/deep-pyramidal-residual-networks","paper_url":"http://arxiv.org/abs/1610.02915v4","paper_title":"Deep Pyramidal Residual Networks","code":"https://github.com/osmr/imgclsmob","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":105,"model":"CoPaNet-R-164","metrics":{"Percentage correct":"96.62"},"uses_additional_data":false,"paper_date":"2017-09-29","paper":"/paper/deep-competitive-pathway-networks","paper_url":"http://arxiv.org/abs/1709.10282v1","paper_title":"Deep Competitive Pathway Networks","code":"https://github.com/JiaRenChang/CoPaNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":106,"model":"DenseNet (DenseNet-BC-190)","metrics":{"Percentage correct":"96.54"},"uses_additional_data":false,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":21,"n_unverified":50,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":107,"model":"SKNet-29 (ResNeXt-29, 16×32d)","metrics":{"Percentage correct":"96.53"},"uses_additional_data":false,"paper_date":"2019-03-15","paper":"/paper/selective-kernel-networks","paper_url":"http://arxiv.org/abs/1903.06586v2","paper_title":"Selective Kernel Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":108,"model":"Fractional MP","metrics":{"Percentage correct":"96.5"},"uses_additional_data":false,"paper_date":"2014-12-18","paper":"/paper/fractional-max-pooling","paper_url":"http://arxiv.org/abs/1412.6071v4","paper_title":"Fractional Max-Pooling","code":"https://github.com/facebookresearch/SparseConvNet","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":109,"model":"PDO-eConv (p8, 4.6M)","metrics":{"Percentage correct":"96.5"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":110,"model":"UPANets","metrics":{"Percentage correct":"96.47"},"uses_additional_data":false,"paper_date":"2021-03-15","paper":"/paper/upanets-learning-from-the-universal-pixel","paper_url":"https://arxiv.org/abs/2103.08640v2","paper_title":"UPANets: Learning from the Universal Pixel Attention Networks","code":"https://github.com/hanktseng131415go/UPANets","n_code_links":1,"syntology":null},{"rank_in_archive_order":111,"model":"GAC-SNN","metrics":{"Percentage correct":"96.46"},"uses_additional_data":false,"paper_date":"2023-08-12","paper":"/paper/gated-attention-coding-for-training-high","paper_url":"https://arxiv.org/abs/2308.06582v2","paper_title":"Gated Attention Coding for Training High-performance and Efficient Spiking Neural Networks","code":"https://github.com/bollossom/GAC","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":12}},{"rank_in_archive_order":112,"model":"ViT (lightweight, MAE pretrained)","metrics":{"Percentage correct":"96.41"},"uses_additional_data":false,"paper_date":"2024-02-06","paper":"/paper/pre-training-of-lightweight-vision","paper_url":"https://arxiv.org/abs/2402.03752v1","paper_title":"Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":113,"model":"NAS-RL","metrics":{"Percentage correct":"96.4"},"uses_additional_data":false,"paper_date":"2016-11-05","paper":"/paper/neural-architecture-search-with-reinforcement","paper_url":"http://arxiv.org/abs/1611.01578v2","paper_title":"Neural Architecture Search with Reinforcement Learning","code":"https://github.com/tensorflow/models","n_code_links":12,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":114,"model":"VGG11B(2x) + LocalLearning + CO","metrics":{"Percentage correct":"96.4"},"uses_additional_data":false,"paper_date":"2019-01-20","paper":"/paper/training-neural-networks-with-local-error","paper_url":"https://arxiv.org/abs/1901.06656v2","paper_title":"Training Neural Networks with Local Error Signals","code":"https://github.com/anokland/local-loss","n_code_links":2,"syntology":null},{"rank_in_archive_order":115,"model":"ABNet-2G-R3-Combined","metrics":{"Percentage correct":"96.378"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":116,"model":"Residual Gates + WRN","metrics":{"Percentage correct":"96.35"},"uses_additional_data":false,"paper_date":"2016-11-04","paper":"/paper/learning-identity-mappings-with-residual","paper_url":"http://arxiv.org/abs/1611.01260v2","paper_title":"Learning Identity Mappings with Residual Gates","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":117,"model":"PDO-eConv (p8, 2.62M)","metrics":{"Percentage correct":"96.32"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"SimpleNetv2","metrics":{"Percentage correct":"96.29"},"uses_additional_data":false,"paper_date":"2018-02-17","paper":"/paper/towards-principled-design-of-deep","paper_url":"http://arxiv.org/abs/1802.06205v1","paper_title":"Towards Principled Design of Deep Convolutional Networks: Introducing SimpNet","code":"https://github.com/Coderx7/SimpNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":119,"model":"ResNet56 with reSGHMC","metrics":{"Percentage correct":"96.12"},"uses_additional_data":false,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":120,"model":"Mixer-S/16- SAM","metrics":{"Percentage correct":"96.1"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":121,"model":"ABNet-2G-R3","metrics":{"Percentage correct":"96.088"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":122,"model":"PreActResNet18 (AMP)","metrics":{"Percentage correct":"96.03"},"uses_additional_data":false,"paper_date":"2020-10-10","paper":"/paper/regularizing-neural-networks-via-adversarial","paper_url":"https://arxiv.org/abs/2010.04925v4","paper_title":"Regularizing Neural Networks via Adversarial Model Perturbation","code":"https://github.com/hiyouga/AMP-Regularizer","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":12,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":123,"model":"ConvMixer-256/8","metrics":{"Percentage correct":"96.03"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/patches-are-all-you-need-1","paper_url":"https://arxiv.org/abs/2201.09792v1","paper_title":"Patches Are All You Need?","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":12,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":124,"model":"Local Mixup Resnet18","metrics":{"Percentage correct":"95.97"},"uses_additional_data":false,"paper_date":"2022-01-12","paper":"/paper/preventing-manifold-intrusion-with-locality","paper_url":"https://arxiv.org/abs/2201.04368v1","paper_title":"Preventing Manifold Intrusion with Locality: Local Mixup","code":"https://github.com/raphael-baena/Local-Mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":125,"model":"ABNet-2G-R2","metrics":{"Percentage correct":"95.900"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":126,"model":"ResNet-50x1-ACG (ImageNet-21K)","metrics":{"Percentage correct":"95.78"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/effect-of-large-scale-pre-training-on-full","paper_url":"https://arxiv.org/abs/2106.00116v4","paper_title":"Effect of Pre-Training Scale on Intra- and Inter-Domain Full and Few-Shot Transfer Learning for Natural and Medical X-Ray Chest Images","code":"https://github.com/SLAMPAI/large-scale-pretraining-transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":127,"model":"ResNet18 (FSGDM)","metrics":{"Percentage correct":"95.66"},"uses_additional_data":false,"paper_date":"2024-11-29","paper":"/paper/on-the-performance-analysis-of-momentum","paper_url":"https://arxiv.org/abs/2411.19671v6","paper_title":"On the Performance Analysis of Momentum Method: A Frequency Domain Perspective","code":"https://github.com/yinleung/FSGDM","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":128,"model":"ACN","metrics":{"Percentage correct":"95.6"},"uses_additional_data":false,"paper_date":"2014-12-21","paper":"/paper/striving-for-simplicity-the-all-convolutional","paper_url":"http://arxiv.org/abs/1412.6806v3","paper_title":"Striving for Simplicity: The All Convolutional Net","code":"https://github.com/pytorch/captum","n_code_links":37,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":129,"model":"Evolution ensemble","metrics":{"Percentage correct":"95.6"},"uses_additional_data":false,"paper_date":"2017-03-03","paper":"/paper/large-scale-evolution-of-image-classifiers","paper_url":"http://arxiv.org/abs/1703.01041v2","paper_title":"Large-Scale Evolution of Image Classifiers","code":"https://github.com/marijnvk/LargeScaleEvolution","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":130,"model":"ResNet-18","metrics":{"Percentage correct":"95.55"},"uses_additional_data":false,"paper_date":"2022-06-27","paper":"/paper/benchopt-reproducible-efficient-and","paper_url":"https://arxiv.org/abs/2206.13424v3","paper_title":"Benchopt: Reproducible, efficient and collaborative optimization benchmarks","code":"https://github.com/google-deepmind/optax","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":131,"model":"ABNet-2G-R1","metrics":{"Percentage correct":"95.536"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":132,"model":"SimpleNetv1","metrics":{"Percentage correct":"95.51"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":133,"model":"Mobile Net_Sam","metrics":{"Percentage correct":"95.50"},"uses_additional_data":false,"paper_date":"2018-01-13","paper":"/paper/mobilenetv2-inverted-residuals-and-linear","paper_url":"http://arxiv.org/abs/1801.04381v4","paper_title":"MobileNetV2: Inverted Residuals and Linear Bottlenecks","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":159,"syntology":{"n_ran":85,"n_unverified":26,"n_samples":111,"n_pointer_only_licence":64}},{"rank_in_archive_order":134,"model":"IM-Loss (ResNet-19)","metrics":{"Percentage correct":"95.49"},"uses_additional_data":false,"paper_date":"2022-10-31","paper":"/paper/im-loss-information-maximization-loss-for","paper_url":"https://openreview.net/forum?id=Jw34v_84m2b","paper_title":"IM-Loss: Information Maximization Loss for Spiking Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":135,"model":"ResNet-1001","metrics":{"Percentage correct":"95.4"},"uses_additional_data":false,"paper_date":"2016-03-16","paper":"/paper/identity-mappings-in-deep-residual-networks","paper_url":"http://arxiv.org/abs/1603.05027v3","paper_title":"Identity Mappings in Deep Residual Networks","code":"https://github.com/tensorflow/models/tree/master/research/slim","n_code_links":54,"syntology":{"n_ran":5,"n_unverified":20,"n_samples":25,"n_pointer_only_licence":1}},{"rank_in_archive_order":136,"model":"ResNet32 with reSGHMC","metrics":{"Percentage correct":"95.35"},"uses_additional_data":false,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":137,"model":"ResNet-18+MM+FRL","metrics":{"Percentage correct":"95.33"},"uses_additional_data":false,"paper_date":"2020-11-22","paper":"/paper/towards-class-specific-unit","paper_url":"https://arxiv.org/abs/2011.10951v2","paper_title":"Learning Class Unique Features in Fine-Grained Visual Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":138,"model":"PSN (Modified PLIF Net)","metrics":{"Percentage correct":"95.32"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":139,"model":"CCT-6/3x1","metrics":{"Percentage correct":"95.29"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":140,"model":"MomentumNet","metrics":{"Percentage correct":"95.18"},"uses_additional_data":false,"paper_date":"2021-02-15","paper":"/paper/momentum-residual-neural-networks","paper_url":"https://arxiv.org/abs/2102.07870v3","paper_title":"Momentum Residual Neural Networks","code":"https://github.com/michaelsdr/momentumnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":141,"model":"Context-Aware Pipeline","metrics":{"Percentage correct":"95.16"},"uses_additional_data":false,"paper_date":"2021-12-30","paper":"/paper/context-aware-compilation-of-dnn-training","paper_url":"https://dl.acm.org/doi/abs/10.1145/3494981","paper_title":"Context-Aware Compilation of DNN Training Pipelines across Edge and Cloud","code":"https://github.com/dixiyao/Context-Aware-Compilation-of-DNN-Training-Pipelines-across-Edge-and-Cloud","n_code_links":1,"syntology":null},{"rank_in_archive_order":142,"model":"SRM-ResNet-56","metrics":{"Percentage correct":"95.05","Top-1 Accuracy":"95.05"},"uses_additional_data":false,"paper_date":"2019-03-26","paper":"/paper/srm-a-style-based-recalibration-module-for","paper_url":"http://arxiv.org/abs/1903.10829v1","paper_title":"SRM : A Style-based Recalibration Module for Convolutional Neural Networks","code":"https://github.com/EvgenyKashin/SRMnet","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":143,"model":"MixMatch","metrics":{"Percentage correct":"95.05"},"uses_additional_data":false,"paper_date":"2019-05-06","paper":"/paper/mixmatch-a-holistic-approach-to-semi","paper_url":"https://arxiv.org/abs/1905.02249v2","paper_title":"MixMatch: A Holistic Approach to Semi-Supervised Learning","code":"https://github.com/google-research/mixmatch","n_code_links":30,"syntology":{"n_ran":47,"n_unverified":16,"n_samples":63,"n_pointer_only_licence":32}},{"rank_in_archive_order":144,"model":"WRN-22-8 (Sparse Momentum)","metrics":{"Percentage correct":"95.04"},"uses_additional_data":false,"paper_date":"2019-07-10","paper":"/paper/sparse-networks-from-scratch-faster-training","paper_url":"https://arxiv.org/abs/1907.04840v2","paper_title":"Sparse Networks from Scratch: Faster Training without Losing Performance","code":"https://github.com/TimDettmers/sparse_learning","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":145,"model":"LP-BNN (ours) + cutout","metrics":{"Percentage correct":"95.02"},"uses_additional_data":false,"paper_date":"2020-12-04","paper":"/paper/encoding-the-latent-posterior-of-bayesian","paper_url":"https://arxiv.org/abs/2012.02818v2","paper_title":"Encoding the latent posterior of Bayesian Neural Networks for uncertainty quantification","code":"https://github.com/ENSTA-U2IS-AI/torch-uncertainty","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":146,"model":"kEffNet-B0 V2 32ch + H Flip","metrics":{"Percentage correct":"94.95"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/an-enhanced-scheme-for-reducing-the","paper_url":"https://www.researchgate.net/publication/363413038_An_Enhanced_Scheme_for_Reducing_the_Complexity_of_Pointwise_Convolutions_in_CNNs_for_Image_Classification_Based_on_Interleaved_Grouped_Filters_without_Divisibility_Constraints","paper_title":"An Enhanced Scheme for Reducing the Complexity of Pointwise Convolutions in CNNs for Image Classification Based on Interleaved Grouped Filters without Divisibility Constraints","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":147,"model":"Prodpoly","metrics":{"Percentage correct":"94.9"},"uses_additional_data":false,"paper_date":"2020-06-20","paper":"/paper/deep-polynomial-neural-networks","paper_url":"https://arxiv.org/abs/2006.13026v2","paper_title":"Deep Polynomial Neural Networks","code":"https://github.com/Faceplugin-ltd/FaceRecognition-Android","n_code_links":5,"syntology":null},{"rank_in_archive_order":148,"model":"ResNet-9","metrics":{"Percentage correct":"94.79"},"uses_additional_data":true,"paper_date":"2022-03-29","paper":"/paper/cnn-filter-db-an-empirical-investigation-of","paper_url":"https://arxiv.org/abs/2203.15331v2","paper_title":"CNN Filter DB: An Empirical Investigation of Trained Convolutional Filters","code":"https://github.com/paulgavrikov/cnn-filter-db","n_code_links":1,"syntology":null},{"rank_in_archive_order":149,"model":"Stochastic Depth","metrics":{"Percentage correct":"94.77"},"uses_additional_data":true,"paper_date":"2016-03-30","paper":"/paper/deep-networks-with-stochastic-depth","paper_url":"http://arxiv.org/abs/1603.09382v3","paper_title":"Deep Networks with Stochastic Depth","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":8,"n_unverified":1,"n_samples":9,"n_pointer_only_licence":2}},{"rank_in_archive_order":150,"model":"VGG-19 with GradInit","metrics":{"Percentage correct":"94.71"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/gradinit-learning-to-initialize-neural","paper_url":"https://arxiv.org/abs/2102.08098v3","paper_title":"GradInit: Learning to Initialize Neural Networks for Stable and Efficient Training","code":"https://github.com/zhuchen03/gradinit","n_code_links":2,"syntology":{"n_ran":7,"n_unverified":6,"n_samples":13,"n_pointer_only_licence":12}},{"rank_in_archive_order":151,"model":"ResNet20 with reSGHMC","metrics":{"Percentage correct":"94.62"},"uses_additional_data":false,"paper_date":"2020-08-12","paper":"/paper/non-convex-learning-via-replica-exchange","paper_url":"https://arxiv.org/abs/2008.05367v3","paper_title":"Non-convex Learning via Replica Exchange Stochastic Gradient MCMC","code":"https://github.com/gaoliyao/Replica_Exchange_Stochastic_Gradient_MCMC","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":152,"model":"PDO-eConv (p6m,0.37M)","metrics":{"Percentage correct":"94.62"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":153,"model":"Evolution","metrics":{"Percentage correct":"94.6"},"uses_additional_data":false,"paper_date":"2017-03-03","paper":"/paper/large-scale-evolution-of-image-classifiers","paper_url":"http://arxiv.org/abs/1703.01041v2","paper_title":"Large-Scale Evolution of Image Classifiers","code":"https://github.com/marijnvk/LargeScaleEvolution","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":154,"model":"RL+NT","metrics":{"Percentage correct":"94.6"},"uses_additional_data":false,"paper_date":"2017-07-16","paper":"/paper/efficient-architecture-search-by-network","paper_url":"http://arxiv.org/abs/1707.04873v2","paper_title":"Efficient Architecture Search by Network Transformation","code":"https://github.com/han-cai/EAS","n_code_links":3,"syntology":null},{"rank_in_archive_order":155,"model":"Convolutional Performer for Vision (CPV)","metrics":{"Percentage correct":"94.46"},"uses_additional_data":false,"paper_date":"2022-01-25","paper":"/paper/convolutional-xformers-for-vision","paper_url":"https://arxiv.org/abs/2201.10271v1","paper_title":"Convolutional Xformers for Vision","code":"https://github.com/pranavphoenix/cxv","n_code_links":1,"syntology":null},{"rank_in_archive_order":156,"model":"PreResNet-110","metrics":{"Percentage correct":"94.4367"},"uses_additional_data":false,"paper_date":"2023-02-13","paper":"/paper/how-to-use-dropout-correctly-on-residual","paper_url":"https://arxiv.org/abs/2302.06112v1","paper_title":"How to Use Dropout Correctly on Residual Networks with Batch Normalization","code":"https://github.com/kmbmjn/DropoutCorrectly","n_code_links":1,"syntology":null},{"rank_in_archive_order":157,"model":"ResNet+ELU","metrics":{"Percentage correct":"94.4"},"uses_additional_data":false,"paper_date":"2016-04-14","paper":"/paper/deep-residual-networks-with-exponential","paper_url":"http://arxiv.org/abs/1604.04112v4","paper_title":"Deep Residual Networks with Exponential Linear Unit","code":"https://github.com/Amihaeseisergiu/Cifar-10-ResNet-ELU-Cutout","n_code_links":1,"syntology":null},{"rank_in_archive_order":158,"model":"Deep Complex","metrics":{"Percentage correct":"94.4"},"uses_additional_data":false,"paper_date":"2017-05-27","paper":"/paper/deep-complex-networks","paper_url":"http://arxiv.org/abs/1705.09792v4","paper_title":"Deep Complex Networks","code":"https://github.com/ChihebTrabelsi/deep_complex_networks","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":3}},{"rank_in_archive_order":159,"model":"PDO-eConv (p6,0.36M)","metrics":{"Percentage correct":"94.35"},"uses_additional_data":false,"paper_date":"2020-07-20","paper":"/paper/pdo-econvs-partial-differential-operator","paper_url":"https://arxiv.org/abs/2007.10408v2","paper_title":"PDO-eConvs: Partial Differential Operator Based Equivariant Convolutions","code":"https://github.com/shenzy08/PDO-eConvs","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":160,"model":"Stochastic Optimization of Plain Convolutional Neural Networks with Simple methods","metrics":{"Percentage correct":"94.29"},"uses_additional_data":false,"paper_date":"2020-01-24","paper":"/paper/stochastic-optimization-of-plain","paper_url":"https://arxiv.org/abs/2001.08856v1","paper_title":"Stochastic Optimization of Plain Convolutional Neural Networks with Simple methods","code":"https://github.com/junaidaliop/MNIST-SOPCNN","n_code_links":1,"syntology":null},{"rank_in_archive_order":161,"model":"Fitnet4-LSUV","metrics":{"Percentage correct":"94.2"},"uses_additional_data":false,"paper_date":"2015-11-19","paper":"/paper/all-you-need-is-a-good-init","paper_url":"http://arxiv.org/abs/1511.06422v7","paper_title":"All you need is a good init","code":"https://github.com/ducha-aiki/LSUVinit","n_code_links":11,"syntology":{"n_ran":0,"n_unverified":19,"n_samples":19,"n_pointer_only_licence":2}},{"rank_in_archive_order":162,"model":"R-ExplaiNet-26","metrics":{"Parameters":"0.89 M","Percentage correct":"94.15"},"uses_additional_data":false,"paper_date":"2024-10-31","paper":"/paper/learning-local-discrete-features-in","paper_url":"https://arxiv.org/abs/2411.00139v1","paper_title":"Learning local discrete features in explainable-by-design convolutional neural networks","code":"https://github.com/pikaplan/LearnExplaiNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":163,"model":"ABNet-2G-R0","metrics":{"Percentage correct":"94.118"},"uses_additional_data":false,"paper_date":"2024-11-28","paper":"/paper/andhra-bandersnatch-training-neural-networks","paper_url":"https://arxiv.org/abs/2411.19213v1","paper_title":"ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities","code":"https://github.com/dvssajay/New_World","n_code_links":1,"syntology":null},{"rank_in_archive_order":164,"model":"ResNet 9 + Mish","metrics":{"Percentage correct":"94.05"},"uses_additional_data":false,"paper_date":"2019-08-23","paper":"/paper/mish-a-self-regularized-non-monotonic-neural","paper_url":"https://arxiv.org/abs/1908.08681v3","paper_title":"Mish: A Self Regularized Non-Monotonic Activation Function","code":"https://github.com/tensorflow/addons","n_code_links":9,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":165,"model":"Tree+Max-Avg pooling","metrics":{"Percentage correct":"94.0"},"uses_additional_data":false,"paper_date":"2015-09-30","paper":"/paper/generalizing-pooling-functions-in","paper_url":"http://arxiv.org/abs/1509.08985v2","paper_title":"Generalizing Pooling Functions in Convolutional Neural Networks: Mixed, Gated, and Tree","code":"https://github.com/cypw/DPNs","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":11,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":166,"model":"Beta-Rank","metrics":{"Percentage correct":"93.97"},"uses_additional_data":false,"paper_date":"2023-04-15","paper":"/paper/beta-rank-a-robust-convolutional-filter","paper_url":"https://arxiv.org/abs/2304.07461v2","paper_title":"Beta-Rank: A Robust Convolutional Filter Pruning Method For Imbalanced Medical Image Analysis","code":"https://github.com/mohofar/beta-rank","n_code_links":1,"syntology":null},{"rank_in_archive_order":167,"model":"ResNet-110 (SAP)","metrics":{"Percentage correct":"93.861"},"uses_additional_data":false,"paper_date":"2024-09-25","paper":"/paper/stochastic-subsampling-with-average-pooling","paper_url":"https://arxiv.org/abs/2409.16630v1","paper_title":"Stochastic Subsampling With Average Pooling","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":168,"model":"SA quadratic embedding","metrics":{"Percentage correct":"93.8"},"uses_additional_data":false,"paper_date":"2019-11-08","paper":"/paper/on-the-relationship-between-self-attention-1","paper_url":"https://arxiv.org/abs/1911.03584v2","paper_title":"On the Relationship between Self-Attention and Convolutional Layers","code":"https://github.com/epfml/attention-cnn","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":12,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":169,"model":"kEffNet-B0 32ch","metrics":{"Percentage correct":"93.75"},"uses_additional_data":false,"paper_date":"2022-06-30","paper":"/paper/grouped-pointwise-convolutions-reduce","paper_url":"https://www.researchgate.net/publication/360226228_Grouped_Pointwise_Convolutions_Reduce_Parameters_in_Convolutional_Neural_Networks","paper_title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":170,"model":"OTTT","metrics":{"Percentage correct":"93.73"},"uses_additional_data":false,"paper_date":"2022-10-09","paper":"/paper/online-training-through-time-for-spiking","paper_url":"https://arxiv.org/abs/2210.04195v2","paper_title":"Online Training Through Time for Spiking Neural Networks","code":"https://github.com/pkuxmq/ottt-snn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":171,"model":"SSCNN","metrics":{"Percentage correct":"93.7"},"uses_additional_data":false,"paper_date":"2014-09-22","paper":"/paper/spatially-sparse-convolutional-neural","paper_url":"http://arxiv.org/abs/1409.6070v1","paper_title":"Spatially-sparse convolutional neural networks","code":"https://github.com/facebookresearch/SparseConvNet","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":172,"model":"NNCLR","metrics":{"Percentage correct":"93.7"},"uses_additional_data":false,"paper_date":"2021-04-29","paper":"/paper/with-a-little-help-from-my-friends-nearest","paper_url":"https://arxiv.org/abs/2104.14548v2","paper_title":"With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations","code":"https://github.com/lightly-ai/lightly","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":173,"model":"Tuned CNN","metrics":{"Percentage correct":"93.6"},"uses_additional_data":false,"paper_date":"2015-02-19","paper":"/paper/scalable-bayesian-optimization-using-deep","paper_url":"http://arxiv.org/abs/1502.05700v2","paper_title":"Scalable Bayesian Optimization Using Deep Neural Networks","code":"https://github.com/automl/pybnn","n_code_links":4,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":174,"model":"Exponential Linear Units","metrics":{"Percentage correct":"93.5"},"uses_additional_data":false,"paper_date":"2015-11-23","paper":"/paper/fast-and-accurate-deep-network-learning-by","paper_url":"http://arxiv.org/abs/1511.07289v5","paper_title":"Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Fast_and_Accurate_Deep_Network_Learning_by_Exponential_Linear_Units_ELUs","n_code_links":16,"syntology":{"n_ran":3,"n_unverified":4,"n_samples":7,"n_pointer_only_licence":2}},{"rank_in_archive_order":175,"model":"BNM NiN","metrics":{"Percentage correct":"93.3"},"uses_additional_data":false,"paper_date":"2015-11-09","paper":"/paper/batch-normalized-maxout-network-in-network","paper_url":"http://arxiv.org/abs/1511.02583v1","paper_title":"Batch-normalized Maxout Network in Network","code":"https://github.com/JohnBensen1000/machine_learning","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":176,"model":"Universum Prescription","metrics":{"Percentage correct":"93.3"},"uses_additional_data":false,"paper_date":"2015-11-11","paper":"/paper/universum-prescription-regularization-using","paper_url":"http://arxiv.org/abs/1511.03719v7","paper_title":"Universum Prescription: Regularization using Unlabeled Data","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":177,"model":"CMsC","metrics":{"Percentage correct":"93.1"},"uses_additional_data":false,"paper_date":"2015-11-18","paper":"/paper/competitive-multi-scale-convolution","paper_url":"http://arxiv.org/abs/1511.05635v1","paper_title":"Competitive Multi-scale Convolution","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":178,"model":"DGPPF-ResNet18","metrics":{"Percentage correct":"92.90"},"uses_additional_data":false,"paper_date":"2024-02-15","paper":"/paper/distilled-gradual-pruning-with-pruned-fine","paper_url":"https://ieeexplore.ieee.org/document/10438214","paper_title":"Distilled Gradual Pruning with Pruned Fine-tuning","code":"https://github.com/rom42pla/dg2pf","n_code_links":1,"syntology":null},{"rank_in_archive_order":179,"model":"kMobileNet V3 Large 16ch","metrics":{"Percentage correct":"92.74"},"uses_additional_data":false,"paper_date":"2022-06-30","paper":"/paper/grouped-pointwise-convolutions-reduce","paper_url":"https://www.researchgate.net/publication/360226228_Grouped_Pointwise_Convolutions_Reduce_Parameters_in_Convolutional_Neural_Networks","paper_title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":180,"model":"NiN+APL","metrics":{"Percentage correct":"92.5"},"uses_additional_data":false,"paper_date":"2014-12-21","paper":"/paper/learning-activation-functions-to-improve-deep","paper_url":"http://arxiv.org/abs/1412.6830v3","paper_title":"Learning Activation Functions to Improve Deep Neural Networks","code":"https://github.com/ForestAgostinelli/Learned-Activation-Functions-Source","n_code_links":3,"syntology":null},{"rank_in_archive_order":181,"model":"VDN","metrics":{"Percentage correct":"92.4"},"uses_additional_data":false,"paper_date":"2015-07-22","paper":"/paper/training-very-deep-networks","paper_url":"http://arxiv.org/abs/1507.06228v2","paper_title":"Training Very Deep Networks","code":"https://github.com/LiyuanLucasLiu/LM-LSTM-CRF","n_code_links":3,"syntology":null},{"rank_in_archive_order":182,"model":"ResNet","metrics":{"Percentage correct":"92.3"},"uses_additional_data":false,"paper_date":"2021-05-10","paper":"/paper/a-bregman-learning-framework-for-sparse","paper_url":"https://arxiv.org/abs/2105.04319v3","paper_title":"A Bregman Learning Framework for Sparse Neural Networks","code":"https://github.com/TimRoith/BregmanLearning","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":9,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":183,"model":"SWWAE","metrics":{"Percentage correct":"92.2"},"uses_additional_data":false,"paper_date":"2015-06-08","paper":"/paper/stacked-what-where-auto-encoders","paper_url":"http://arxiv.org/abs/1506.02351v8","paper_title":"Stacked What-Where Auto-encoders","code":"https://github.com/isaacgerg/keras_odds_and_ends","n_code_links":2,"syntology":null},{"rank_in_archive_order":184,"model":"FlexTCN-7","metrics":{"Percentage correct":"92.2"},"uses_additional_data":false,"paper_date":"2021-10-15","paper":"/paper/flexconv-continuous-kernel-convolutions-with-1","paper_url":"https://arxiv.org/abs/2110.08059v3","paper_title":"FlexConv: Continuous Kernel Convolutions with Differentiable Kernel Sizes","code":"https://github.com/rjbruin/flexconv","n_code_links":1,"syntology":null},{"rank_in_archive_order":185,"model":"ReActNet-18","metrics":{"Percentage correct":"92.08"},"uses_additional_data":false,"paper_date":"2021-04-16","paper":"/paper/bnn-bn-training-binary-neural-networks","paper_url":"https://arxiv.org/abs/2104.08215v1","paper_title":"\"BNN - BN = ?\": Training Binary Neural Networks without Batch Normalization","code":"https://github.com/VITA-Group/BNN_NoBN","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":7,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":186,"model":"ResNet v2-20 (Mish activation)","metrics":{"Percentage correct":"92.02"},"uses_additional_data":false,"paper_date":"2019-08-23","paper":"/paper/mish-a-self-regularized-non-monotonic-neural","paper_url":"https://arxiv.org/abs/1908.08681v3","paper_title":"Mish: A Self Regularized Non-Monotonic Activation Function","code":"https://github.com/tensorflow/addons","n_code_links":9,"syntology":{"n_ran":4,"n_unverified":8,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":187,"model":"Context-Aware DNN tree","metrics":{"Percentage correct":"92.01"},"uses_additional_data":false,"paper_date":"2020-11-29","paper":"/paper/context-aware-deep-model-compression-for-edge","paper_url":"https://ieeexplore.ieee.org/abstract/document/9355722","paper_title":"Context-aware deep model compression for edge cloud computing","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":188,"model":"DSN","metrics":{"Percentage correct":"91.8"},"uses_additional_data":false,"paper_date":"2014-09-18","paper":"/paper/deeply-supervised-nets","paper_url":"http://arxiv.org/abs/1409.5185v2","paper_title":"Deeply-Supervised Nets","code":"https://github.com/ellisdg/3DUnetCNN","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":21,"n_samples":21,"n_pointer_only_licence":0}},{"rank_in_archive_order":189,"model":"BinaryConnect","metrics":{"Percentage correct":"91.7"},"uses_additional_data":false,"paper_date":"2015-11-02","paper":"/paper/binaryconnect-training-deep-neural-networks","paper_url":"http://arxiv.org/abs/1511.00363v3","paper_title":"BinaryConnect: Training Deep Neural Networks with binary weights during propagations","code":"https://github.com/tensorpack/tensorpack/tree/master/examples/DoReFa-Net","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":190,"model":"CLS-GAN","metrics":{"Percentage correct":"91.7"},"uses_additional_data":false,"paper_date":"2017-01-23","paper":"/paper/loss-sensitive-generative-adversarial","paper_url":"http://arxiv.org/abs/1701.06264v6","paper_title":"Loss-Sensitive Generative Adversarial Networks on Lipschitz Densities","code":"https://github.com/guojunq/lsgan","n_code_links":1,"syntology":null},{"rank_in_archive_order":191,"model":"MIM","metrics":{"Percentage correct":"91.5"},"uses_additional_data":false,"paper_date":"2015-08-03","paper":"/paper/on-the-importance-of-normalisation-layers-in","paper_url":"http://arxiv.org/abs/1508.00330v2","paper_title":"On the Importance of Normalisation Layers in Deep Learning with Piecewise Linear Activation Units","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":192,"model":"Spectral Representations for Convolutional Neural Networks","metrics":{"Percentage correct":"91.4"},"uses_additional_data":false,"paper_date":"2015-06-11","paper":"/paper/spectral-representations-for-convolutional","paper_url":"http://arxiv.org/abs/1506.03767v1","paper_title":"Spectral Representations for Convolutional Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":193,"model":"DLME (ResNet-18, linear)","metrics":{"Percentage correct":"91.3"},"uses_additional_data":false,"paper_date":"2022-07-07","paper":"/paper/dlme-deep-local-flatness-manifold-embedding","paper_url":"https://arxiv.org/abs/2207.03160v2","paper_title":"DLME: Deep Local-flatness Manifold Embedding","code":"https://github.com/Westlake-AI/openmixup","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":194,"model":"RMDL (30 RDLs)","metrics":{"Percentage correct":"91.21"},"uses_additional_data":false,"paper_date":"2018-05-03","paper":"/paper/rmdl-random-multimodel-deep-learning-for","paper_url":"http://arxiv.org/abs/1805.01890v2","paper_title":"RMDL: Random Multimodel Deep Learning for Classification","code":"https://github.com/kk7nc/RMDL","n_code_links":1,"syntology":null},{"rank_in_archive_order":195,"model":"Network in Network","metrics":{"Percentage correct":"91.2"},"uses_additional_data":false,"paper_date":"2013-12-16","paper":"/paper/network-in-network","paper_url":"http://arxiv.org/abs/1312.4400v3","paper_title":"Network In Network","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Network_In_Network","n_code_links":17,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":196,"model":"ResNet-26 (Trainable Activations)","metrics":{"Percentage correct":"91.1"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":197,"model":"ResNet-32 (Trainable Activations)","metrics":{"Percentage correct":"90.9"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":198,"model":"kDenseNet-BC L100 12ch","metrics":{"Percentage correct":"90.83"},"uses_additional_data":false,"paper_date":"2022-06-30","paper":"/paper/grouped-pointwise-convolutions-reduce","paper_url":"https://www.researchgate.net/publication/360226228_Grouped_Pointwise_Convolutions_Reduce_Parameters_in_Convolutional_Neural_Networks","paper_title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":199,"model":"Deep Networks with Internal Selective Attention through Feedback Connections","metrics":{"Percentage correct":"90.8"},"uses_additional_data":false,"paper_date":"2014-07-11","paper":"/paper/deep-networks-with-internal-selective","paper_url":"http://arxiv.org/abs/1407.3068v2","paper_title":"Deep Networks with Internal Selective Attention through Feedback Connections","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":200,"model":"Maxout Network (k=2)","metrics":{"Percentage correct":"90.65"},"uses_additional_data":false,"paper_date":"2013-02-18","paper":"/paper/maxout-networks","paper_url":"http://arxiv.org/abs/1302.4389v4","paper_title":"Maxout Networks","code":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/tree/main/Maxout_Networks","n_code_links":7,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":201,"model":"ResNet-18","metrics":{"Percentage correct":"90.65"},"uses_additional_data":true,"paper_date":"2019-11-13","paper":"/paper/knowledge-representing-efficient-sparse","paper_url":"https://arxiv.org/abs/1911.05329v1","paper_title":"Knowledge Representing: Efficient, Sparse Representation of Prior Knowledge for Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":202,"model":"DNN+Probabilistic Maxout","metrics":{"Percentage correct":"90.6"},"uses_additional_data":true,"paper_date":"2013-12-20","paper":"/paper/improving-deep-neural-networks-with","paper_url":"http://arxiv.org/abs/1312.6116v2","paper_title":"Improving Deep Neural Networks with Probabilistic Maxout Units","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":203,"model":"GP EI","metrics":{"Percentage correct":"90.5"},"uses_additional_data":false,"paper_date":"2012-06-13","paper":"/paper/practical-bayesian-optimization-of-machine","paper_url":"http://arxiv.org/abs/1206.2944v2","paper_title":"Practical Bayesian Optimization of Machine Learning Algorithms","code":"https://github.com/HIPS/Spearmint","n_code_links":4,"syntology":null},{"rank_in_archive_order":204,"model":"ResNet-44 (Trainable Activations)","metrics":{"Percentage correct":"90.5"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":205,"model":"ResNet-20 (Trainable Activations)","metrics":{"Percentage correct":"90.4"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":206,"model":"SEER (RegNet10B)","metrics":{"Percentage correct":"90"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":207,"model":"kMobileNet 16ch","metrics":{"Percentage correct":"89.81"},"uses_additional_data":false,"paper_date":"2022-06-30","paper":"/paper/grouped-pointwise-convolutions-reduce","paper_url":"https://www.researchgate.net/publication/360226228_Grouped_Pointwise_Convolutions_Reduce_Parameters_in_Convolutional_Neural_Networks","paper_title":"Grouped Pointwise Convolutions Reduce Parameters in Convolutional Neural Networks","code":"https://github.com/joaopauloschuler/k-neural-api","n_code_links":2,"syntology":null},{"rank_in_archive_order":208,"model":"APAC","metrics":{"Percentage correct":"89.7"},"uses_additional_data":false,"paper_date":"2015-05-13","paper":"/paper/apac-augmented-pattern-classification-with","paper_url":"http://arxiv.org/abs/1505.03229v1","paper_title":"APAC: Augmented PAttern Classification with Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":209,"model":"ensemble of 7 models","metrics":{"Percentage correct":"89.4"},"uses_additional_data":false,"paper_date":"2017-10-26","paper":"/paper/dynamic-routing-between-capsules","paper_url":"http://arxiv.org/abs/1710.09829v2","paper_title":"Dynamic Routing Between Capsules","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":77,"syntology":{"n_ran":18,"n_unverified":100,"n_samples":118,"n_pointer_only_licence":12}},{"rank_in_archive_order":210,"model":"DCNN+GFE","metrics":{"Percentage correct":"89.1"},"uses_additional_data":false,"paper_date":"2017-10-06","paper":"/paper/deep-convolutional-neural-networks-as-generic","paper_url":"http://arxiv.org/abs/1710.02286v1","paper_title":"Deep Convolutional Neural Networks as Generic Feature Extractors","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":211,"model":"DCNN","metrics":{"Percentage correct":"89"},"uses_additional_data":false,"paper_date":"2012-12-01","paper":"/paper/imagenet-classification-with-deep","paper_url":"http://papers.nips.cc/paper/4824-imagenet-classification-with-deep-convolutional-neural-networks","paper_title":"ImageNet Classification with Deep Convolutional Neural Networks","code":"https://github.com/pytorch/vision","n_code_links":23,"syntology":null},{"rank_in_archive_order":212,"model":"ResNet-14 (Trainable Activations)","metrics":{"Percentage correct":"89.0"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":213,"model":"MCDNN","metrics":{"Percentage correct":"88.8"},"uses_additional_data":false,"paper_date":"2012-02-13","paper":"/paper/multi-column-deep-neural-networks-for-image","paper_url":"http://arxiv.org/abs/1202.2745v1","paper_title":"Multi-column Deep Neural Networks for Image Classification","code":"https://github.com/hughperkins/DeepCL","n_code_links":1,"syntology":null},{"rank_in_archive_order":214,"model":"RReLU","metrics":{"Percentage correct":"88.8"},"uses_additional_data":false,"paper_date":"2015-05-05","paper":"/paper/empirical-evaluation-of-rectified-activations","paper_url":"http://arxiv.org/abs/1505.00853v2","paper_title":"Empirical Evaluation of Rectified Activations in Convolutional Network","code":"https://github.com/OsvaldN/APS360_Project","n_code_links":2,"syntology":null},{"rank_in_archive_order":215,"model":"ResNet-56 (Trainable Activations)","metrics":{"Percentage correct":"88.8"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":216,"model":"F-DENSER++","metrics":{"Percentage correct":"88.73"},"uses_additional_data":false,"paper_date":"2019-05-08","paper":"/paper/fast-denser-evolving-fully-trained-deep","paper_url":"https://arxiv.org/abs/1905.02969v1","paper_title":"Fast-DENSER++: Evolving Fully-Trained Deep Artificial Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":217,"model":"Diffusion Classifier (zero-shot)","metrics":{"Percentage correct":"88.5"},"uses_additional_data":false,"paper_date":"2023-03-28","paper":"/paper/your-diffusion-model-is-secretly-a-zero-shot","paper_url":"https://arxiv.org/abs/2303.16203v3","paper_title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","code":"https://github.com/diffusion-classifier/diffusion-classifier","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":218,"model":"ReNet","metrics":{"Percentage correct":"87.7"},"uses_additional_data":true,"paper_date":"2015-05-03","paper":"/paper/renet-a-recurrent-neural-network-based","paper_url":"http://arxiv.org/abs/1505.00393v3","paper_title":"ReNet: A Recurrent Neural Network Based Alternative to Convolutional Networks","code":"https://github.com/fvisin/reseg","n_code_links":4,"syntology":null},{"rank_in_archive_order":219,"model":"OnDev-LCT-8/3","metrics":{"Parameters":"0.95M","Percentage correct":"87.65","Top-1 Accuracy":"87.65"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":220,"model":"OnDev-LCT-4/3","metrics":{"Parameters":"0.55M","Percentage correct":"87.03","Top-1 Accuracy":"87.03"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":221,"model":"TripleNet-B","metrics":{"Percentage correct":"87.03"},"uses_additional_data":false,"paper_date":"2022-04-02","paper":"/paper/triplenet-a-low-computing-power-platform-of","paper_url":"https://arxiv.org/abs/2204.00943v4","paper_title":"Efficient Convolutional Neural Networks on Raspberry Pi for Image Classification","code":"https://github.com/RuiyangJu/TripleNet","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":222,"model":"An Analysis of Unsupervised Pre-training in Light of Recent Advances","metrics":{"Percentage correct":"86.7"},"uses_additional_data":false,"paper_date":"2014-12-20","paper":"/paper/an-analysis-of-unsupervised-pre-training-in","paper_url":"http://arxiv.org/abs/1412.6597v4","paper_title":"An Analysis of Unsupervised Pre-training in Light of Recent Advances","code":"https://github.com/ifp-uiuc/anna","n_code_links":2,"syntology":null},{"rank_in_archive_order":223,"model":"ThreshNet95","metrics":{"Percentage correct":"86.69"},"uses_additional_data":false,"paper_date":"2022-01-09","paper":"/paper/threshnet-an-efficient-densenet-using","paper_url":"https://arxiv.org/abs/2201.03013v2","paper_title":"ThreshNet: An Efficient DenseNet Using Threshold Mechanism to Reduce Connections","code":"https://github.com/ruiyangju/threshnet","n_code_links":1,"syntology":null},{"rank_in_archive_order":224,"model":"OnDev-LCT-8/1","metrics":{"Parameters":"0.91M","Percentage correct":"86.64","Top-1 Accuracy":"86.64"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":225,"model":"ShortNet1-53","metrics":{"Percentage correct":"86.64"},"uses_additional_data":false,"paper_date":"2022-08-02","paper":"/paper/connection-reduction-is-all-you-need","paper_url":"https://arxiv.org/abs/2208.01424v3","paper_title":"Connection Reduction of DenseNet for Image Recognition","code":"https://github.com/ruiyangju/connection_reduction","n_code_links":1,"syntology":null},{"rank_in_archive_order":226,"model":"OnDev-LCT-4/1","metrics":{"Parameters":"0.51M","Percentage correct":"86.61","Top-1 Accuracy":"86.61"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":227,"model":"CNN+ Wilson-Cowan model RNN","metrics":{"Percentage correct":"86.59"},"uses_additional_data":false,"paper_date":"2024-06-24","paper":"/paper/learning-in-wilson-cowan-model-for","paper_url":"https://arxiv.org/abs/2406.16453v2","paper_title":"Learning in Wilson-Cowan model for metapopulation","code":"https://github.com/raffaelemarino/learning_in_wilsoncowan","n_code_links":1,"syntology":null},{"rank_in_archive_order":228,"model":"ResNet-8 (Trainable Activations)","metrics":{"Percentage correct":"86.5"},"uses_additional_data":false,"paper_date":"2023-01-26","paper":"/paper/trainable-activations-for-image","paper_url":"https://doi.org/10.20944/preprints202301.0463.v1","paper_title":"Trainable Activations for Image Classification","code":"https://github.com/Pe4enIks/TrainableActivation","n_code_links":1,"syntology":null},{"rank_in_archive_order":229,"model":"ThresholdNet","metrics":{"Percentage correct":"86.34"},"uses_additional_data":false,"paper_date":"2021-08-28","paper":"/paper/threshold-pruning-tool-for-densely-connected","paper_url":"https://arxiv.org/abs/2108.12604v4","paper_title":"New Pruning Method Based on DenseNet Network for Image Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":230,"model":"OnDev-LCT-2/1","metrics":{"Parameters":"0.31M","Percentage correct":"86.27","Top-1 Accuracy":"86.27"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":231,"model":"OnDev-LCT-2/3","metrics":{"Parameters":"0.35M","Percentage correct":"86.04","Top-1 Accuracy":"86.04"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":232,"model":"OnDev-LCT-1/3","metrics":{"Parameters":"0.25M","Percentage correct":"85.73","Top-1 Accuracy":"85.73"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":233,"model":"cvpr_class","metrics":{"Percentage correct":"85.28"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":234,"model":"WaveMix","metrics":{"Percentage correct":"85.21"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/wavemix-multi-resolution-token-mixing-for","paper_url":"https://openreview.net/forum?id=tBoSm4hUWV","paper_title":"WaveMix: Multi-Resolution Token Mixing for Images","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":235,"model":"Stochastic Pooling","metrics":{"Percentage correct":"84.9"},"uses_additional_data":false,"paper_date":"2013-01-16","paper":"/paper/stochastic-pooling-for-regularization-of-deep","paper_url":"http://arxiv.org/abs/1301.3557v1","paper_title":"Stochastic Pooling for Regularization of Deep Convolutional Neural Networks","code":"https://github.com/szagoruyko/imagine-nn","n_code_links":1,"syntology":null},{"rank_in_archive_order":236,"model":"OnDev-LCT-1/1","metrics":{"Parameters":"0.21M","Percentage correct":"84.55","Top-1 Accuracy":"84.55"},"uses_additional_data":false,"paper_date":"2024-01-22","paper":"/paper/ondev-lct-on-device-lightweight-convolutional","paper_url":"https://arxiv.org/abs/2401.11652v1","paper_title":"OnDev-LCT: On-Device Lightweight Convolutional Transformers towards federated learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":237,"model":"Improving neural networks by preventing co-adaptation of feature detectors","metrics":{"Percentage correct":"84.4"},"uses_additional_data":false,"paper_date":"2012-07-03","paper":"/paper/improving-neural-networks-by-preventing-co","paper_url":"http://arxiv.org/abs/1207.0580v1","paper_title":"Improving neural networks by preventing co-adaptation of feature detectors","code":"https://github.com/dnouri/cuda-convnet","n_code_links":11,"syntology":null},{"rank_in_archive_order":238,"model":"CCN","metrics":{"Percentage correct":"83.36"},"uses_additional_data":true,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":239,"model":"CvN","metrics":{"Percentage correct":"83.26"},"uses_additional_data":true,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":240,"model":"UL-Hopfield (ULH)","metrics":{"Percentage correct":"83.1"},"uses_additional_data":false,"paper_date":"2018-05-02","paper":"/paper/unsupervised-learning-using-pretrained-cnn","paper_url":"http://arxiv.org/abs/1805.01033v1","paper_title":"Unsupervised Learning using Pretrained CNN and Associative Memory Bank","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":241,"model":"DCGAN","metrics":{"Percentage correct":"82.8"},"uses_additional_data":true,"paper_date":"2015-11-19","paper":"/paper/unsupervised-representation-learning-with-1","paper_url":"http://arxiv.org/abs/1511.06434v2","paper_title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","code":"https://github.com/tensorflow/models/blob/master/research/slim/nets/dcgan.py","n_code_links":258,"syntology":{"n_ran":115,"n_unverified":104,"n_samples":219,"n_pointer_only_licence":111}},{"rank_in_archive_order":242,"model":"TM Composites Toolbox","metrics":{"Percentage correct":"82.8"},"uses_additional_data":true,"paper_date":"2024-06-02","paper":"/paper/an-optimized-toolbox-for-advanced-image","paper_url":"https://arxiv.org/abs/2406.00704v1","paper_title":"An Optimized Toolbox for Advanced Image Processing with Tsetlin Machine Composites","code":"https://github.com/cair/An-Optimized-Toolbox-for-Advanced-Image-Processing-with-Tsetlin-Machine-Composites","n_code_links":1,"syntology":null},{"rank_in_archive_order":243,"model":"CKN","metrics":{"Percentage correct":"82.2"},"uses_additional_data":false,"paper_date":"2014-06-12","paper":"/paper/convolutional-kernel-networks","paper_url":"http://arxiv.org/abs/1406.3332v2","paper_title":"Convolutional Kernel Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":244,"model":"The Analog Activation Function","metrics":{"Cross Entropy Loss":"0.5551","Parameters":"545100","Percentage correct":"82.06","Top 1 Accuracy":"82.06"},"uses_additional_data":false,"paper_date":"2025-02-13","paper":"/paper/evaluating-the-performance-of-taaf-for-image","paper_url":"https://www.academia.edu/127610553/The_Analog_Activation_Function_TAAF_of_Emergent_Linear_Systems_Evaluating_the_Performance_of_The_Analog_Activation_Function_TAAF_on_MNIST_and_CIFAR_10_Datasets","paper_title":"Evaluating the Performance of TAAF for image classification models","code":"https://github.com/bryn-gnolbs/TAAF-for-Image-Classification","n_code_links":1,"syntology":null},{"rank_in_archive_order":245,"model":"Discriminative Unsupervised Feature Learning with Convolutional Neural Networks","metrics":{"Percentage correct":"82"},"uses_additional_data":false,"paper_date":"2014-12-01","paper":"/paper/discriminative-unsupervised-feature-learning-1","paper_url":"http://papers.nips.cc/paper/5548-discriminative-unsupervised-feature-learning-with-convolutional-neural-networks","paper_title":"Discriminative Unsupervised Feature Learning with Convolutional Neural Networks","code":"https://github.com/Octavio-Pappalardo/unsupervised-pretraining-via-self-classification","n_code_links":1,"syntology":null},{"rank_in_archive_order":246,"model":"Sign-symmetry","metrics":{"Percentage correct":"80.98"},"uses_additional_data":true,"paper_date":"2015-10-17","paper":"/paper/how-important-is-weight-symmetry-in","paper_url":"http://arxiv.org/abs/1510.05067v4","paper_title":"How Important is Weight Symmetry in Backpropagation?","code":"https://github.com/jsalbert/biotorch","n_code_links":2,"syntology":null},{"rank_in_archive_order":247,"model":"pFedBreD_ns_mg","metrics":{"Percentage correct":"80.63"},"uses_additional_data":false,"paper_date":"2022-11-19","paper":"/paper/personalized-federated-learning-with-hidden","paper_url":"https://arxiv.org/abs/2211.10684v2","paper_title":"Personalized Federated Learning with Hidden Information on Personalized Prior","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":248,"model":"1 Layer K-means","metrics":{"Percentage correct":"80.6"},"uses_additional_data":false,"paper_date":"2015-11-19","paper":"/paper/unsupervised-representation-learning-with-1","paper_url":"http://arxiv.org/abs/1511.06434v2","paper_title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","code":"https://github.com/tensorflow/models/blob/master/research/slim/nets/dcgan.py","n_code_links":258,"syntology":{"n_ran":115,"n_unverified":104,"n_samples":219,"n_pointer_only_licence":111}},{"rank_in_archive_order":249,"model":"APVT","metrics":{"Percentage correct":"80.45"},"uses_additional_data":false,"paper_date":"2022-03-02","paper":"/paper/aggregated-pyramid-vision-transformer-split","paper_url":"https://arxiv.org/abs/2203.00960v1","paper_title":"Aggregated Pyramid Vision Transformer: Split-transform-merge Strategy for Image Recognition without Convolutions","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":250,"model":"Learning with Recursive Perceptual Representations","metrics":{"Percentage correct":"79.7"},"uses_additional_data":false,"paper_date":"2012-12-01","paper":"/paper/learning-with-recursive-perceptual","paper_url":"http://papers.nips.cc/paper/4747-learning-with-recursive-perceptual-representations","paper_title":"Learning with Recursive Perceptual Representations","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":251,"model":"LeViP","metrics":{"Percentage correct":"79.50"},"uses_additional_data":false,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":252,"model":"Convolutional Deep Belief Network","metrics":{"Percentage correct":"78.9"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":253,"model":"PCANet","metrics":{"Percentage correct":"78.7"},"uses_additional_data":false,"paper_date":"2014-04-14","paper":"/paper/pcanet-a-simple-deep-learning-baseline-for","paper_url":"http://arxiv.org/abs/1404.3606v2","paper_title":"PCANet: A Simple Deep Learning Baseline for Image Classification?","code":"https://github.com/Ldpe2G/PCANet","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":254,"model":"Hybrid ViT+RoPE","metrics":{"Percentage correct":"76.9"},"uses_additional_data":false,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":255,"model":"FLSCNN","metrics":{"Percentage correct":"75.9"},"uses_additional_data":false,"paper_date":"2015-03-16","paper":"/paper/enhanced-image-classification-with-a-fast","paper_url":"http://arxiv.org/abs/1503.04596v3","paper_title":"Enhanced Image Classification With a Fast-Learning Shallow Convolutional Neural Network","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":256,"model":"Hybrid Vision Nystromformer (ViN)","metrics":{"Percentage correct":"75.26"},"uses_additional_data":false,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":257,"model":"CTM Drop Clause","metrics":{"Percentage correct":"75.1"},"uses_additional_data":false,"paper_date":"2021-05-30","paper":"/paper/human-interpretable-ai-enhancing-tsetlin","paper_url":"https://arxiv.org/abs/2105.14506v2","paper_title":"Drop Clause: Enhancing Performance, Interpretability and Robustness of the Tsetlin Machine","code":"https://github.com/cair/TsetlinMachine","n_code_links":7,"syntology":null},{"rank_in_archive_order":258,"model":"Hybrid PiN","metrics":{"Percentage correct":"74"},"uses_additional_data":false,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":259,"model":"SmoothNetV1","metrics":{"Percentage correct":"73.5"},"uses_additional_data":false,"paper_date":"2022-05-09","paper":"/paper/smoothnets-optimizing-cnn-architecture-design","paper_url":"https://arxiv.org/abs/2205.04095v1","paper_title":"SmoothNets: Optimizing CNN architecture design for differentially private deep learning","code":"https://github.com/NiWaRe/DPBenchmark","n_code_links":1,"syntology":null},{"rank_in_archive_order":260,"model":"SNN","metrics":{"Percentage correct":"68.3"},"uses_additional_data":false,"paper_date":"2023-02-13","paper":"/paper/sneaky-spikes-uncovering-stealthy-backdoor","paper_url":"https://arxiv.org/abs/2302.06279v3","paper_title":"Sneaky Spikes: Uncovering Stealthy Backdoor Attacks in Spiking Neural Networks with Neuromorphic Data","code":"https://github.com/GorkaAbad/Sneaky-Spikes","n_code_links":1,"syntology":null},{"rank_in_archive_order":261,"model":"Vision Nystromformer (ViN)","metrics":{"Percentage correct":"65.06"},"uses_additional_data":false,"paper_date":"2021-07-05","paper":"/paper/vision-xformers-efficient-attention-for-image","paper_url":"https://arxiv.org/abs/2107.02239v4","paper_title":"Vision Xformers: Efficient Attention for Image Classification","code":"https://github.com/pranavphoenix/ViX","n_code_links":2,"syntology":null},{"rank_in_archive_order":262,"model":"ANODE","metrics":{"Percentage correct":"60.6"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/augmented-neural-odes","paper_url":"https://arxiv.org/abs/1904.01681v3","paper_title":"Augmented Neural ODEs","code":"https://github.com/EmilienDupont/augmented-neural-odes","n_code_links":6,"syntology":{"n_ran":2,"n_unverified":7,"n_samples":9,"n_pointer_only_licence":2}},{"rank_in_archive_order":263,"model":"efficient adaptive ensembling","metrics":{"Accuracy":"99.612"},"uses_additional_data":true,"paper_date":"2022-06-15","paper":"/paper/efficient-adaptive-ensembling-for-image","paper_url":"https://arxiv.org/abs/2206.07394v3","paper_title":"Efficient Adaptive Ensembling for Image Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":264,"model":"DGMMC-S","metrics":{"Top 1 Accuracy":"98.8"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/performance-of-gaussian-mixture-model","paper_url":"https://arxiv.org/abs/2410.13421v1","paper_title":"Performance of Gaussian Mixture Model Classifiers on Embedded Feature Spaces","code":"https://github.com/cvmlmu/dgmmc","n_code_links":1,"syntology":null},{"rank_in_archive_order":265,"model":"SAG-ViT","metrics":{"F1":"95.74"},"uses_additional_data":false,"paper_date":"2024-11-14","paper":"/paper/sag-vit-a-scale-aware-high-fidelity-patching","paper_url":"https://arxiv.org/abs/2411.09420v3","paper_title":"SAG-ViT: A Scale-Aware, High-Fidelity Patching Approach with Graph Attention for Vision Transformers","code":"https://github.com/shravan-18/SAG-ViT","n_code_links":1,"syntology":null}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,885 of the 9,623 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9623,"papers_checked":6885,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2737},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-25T09:33:49+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":122,"rows_with_any_sample_ran":100,"distinct_papers_with_graph_line":86,"distinct_papers_with_any_sample_ran":72,"samples_over_distinct_papers":{"n_ran":1250,"n_unverified":909,"n_samples":2159,"n_pointer_only_licence":672,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":1942,"n_unverified":1274,"n_samples":3216,"n_pointer_only_licence":978,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}