{"url":"/sota/image-classification-on-imagenet","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"ImageNet","url":"/dataset/imagenet"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top 1 Accuracy","Number of params","GFLOPs","Hardware Burden","Top 5 Accuracy","Operations per network pass"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top 1 Accuracy":"higher","Number of params":"lower","GFLOPs":null,"Hardware Burden":null,"Top 5 Accuracy":"higher","Operations per network pass":null}},"counts":{"rows":1060,"rows_with_code":988,"rows_with_paper_page":1042,"rows_dated":1042,"rows_using_additional_data":7},"rows":[{"rank_in_archive_order":1,"model":"CoCa (finetuned)","metrics":{"Number of params":"2100M","Top 1 Accuracy":"91.0%"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/coca-contrastive-captioners-are-image-text","paper_url":"https://arxiv.org/abs/2205.01917v2","paper_title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","code":"https://github.com/mlfoundations/open_clip","n_code_links":6,"syntology":{"n_ran":9,"n_unverified":8,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":2,"model":"Model soups (BASIC-L)","metrics":{"Number of params":"2440M","Top 1 Accuracy":"90.98%"},"uses_additional_data":false,"paper_date":"2022-03-10","paper":"/paper/model-soups-averaging-weights-of-multiple","paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","code":"https://github.com/mlfoundations/model-soups","n_code_links":6,"syntology":{"n_ran":5,"n_unverified":12,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"Model soups (ViT-G/14)","metrics":{"Number of params":"1843M","Top 1 Accuracy":"90.94%"},"uses_additional_data":false,"paper_date":"2022-03-10","paper":"/paper/model-soups-averaging-weights-of-multiple","paper_url":"https://arxiv.org/abs/2203.05482v3","paper_title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","code":"https://github.com/mlfoundations/model-soups","n_code_links":6,"syntology":{"n_ran":5,"n_unverified":12,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":4,"model":"DaViT-G","metrics":{"GFLOPs":"1038","Number of params":"1437M","Top 1 Accuracy":"90.4%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"DaViT-H","metrics":{"GFLOPs":"334","Number of params":"362M","Top 1 Accuracy":"90.2%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":6,"model":"Meta Pseudo Labels (EfficientNet-L2)","metrics":{"Hardware Burden":"95040G","Number of params":"480M","Top 1 Accuracy":"90.2%","Top 5 Accuracy":"98.8"},"uses_additional_data":false,"paper_date":"2020-03-23","paper":"/paper/meta-pseudo-labels","paper_url":"https://arxiv.org/abs/2003.10580v4","paper_title":"Meta Pseudo Labels","code":"https://github.com/google-research/google-research/tree/master/meta_pseudo_labels","n_code_links":9,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":7,"model":"SwinV2-G","metrics":{"Number of params":"3000M","Top 1 Accuracy":"90.17%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"MAWS (ViT-6.5B)","metrics":{"Number of params":"6500M","Top 1 Accuracy":"90.1%"},"uses_additional_data":false,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":9,"model":"Florence-CoSwin-H","metrics":{"Number of params":"893M","Top 1 Accuracy":"90.05%","Top 5 Accuracy":"99.02"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/florence-a-new-foundation-model-for-computer","paper_url":"https://arxiv.org/abs/2111.11432v1","paper_title":"Florence: A New Foundation Model for Computer Vision","code":"https://github.com/microsoft/unicl","n_code_links":2,"syntology":null},{"rank_in_archive_order":10,"model":"Meta Pseudo Labels (EfficientNet-B6-Wide)","metrics":{"Number of params":"390M","Top 1 Accuracy":"90%"},"uses_additional_data":false,"paper_date":"2020-03-23","paper":"/paper/meta-pseudo-labels","paper_url":"https://arxiv.org/abs/2003.10580v4","paper_title":"Meta Pseudo Labels","code":"https://github.com/google-research/google-research/tree/master/meta_pseudo_labels","n_code_links":9,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":11,"model":"RevCol-H","metrics":{"Number of params":"2158M","Top 1 Accuracy":"90.0%"},"uses_additional_data":false,"paper_date":"2022-12-22","paper":"/paper/reversible-column-networks","paper_url":"https://arxiv.org/abs/2212.11696v3","paper_title":"Reversible Column Networks","code":"https://github.com/megvii-research/revcol","n_code_links":1,"syntology":{"n_ran":8,"n_unverified":3,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":12,"model":"MAWS (ViT-2B)","metrics":{"Number of params":"2000M","Top 1 Accuracy":"89.8%"},"uses_additional_data":false,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":13,"model":"EVA","metrics":{"Number of params":"1000M","Top 1 Accuracy":"89.7%"},"uses_additional_data":false,"paper_date":"2022-11-14","paper":"/paper/eva-exploring-the-limits-of-masked-visual","paper_url":"https://arxiv.org/abs/2211.07636v2","paper_title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":14,"model":"M3I Pre-training (InternImage-H)","metrics":{"Top 1 Accuracy":"89.6%"},"uses_additional_data":false,"paper_date":"2022-11-17","paper":"/paper/towards-all-in-one-pre-training-via","paper_url":"https://arxiv.org/abs/2211.09807v2","paper_title":"Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information","code":"https://github.com/OpenGVLab/M3I-Pretraining","n_code_links":1,"syntology":null},{"rank_in_archive_order":15,"model":"ViT-L/16 (384res, distilled from ViT-22B)","metrics":{"Number of params":"307M","Top 1 Accuracy":"89.6%"},"uses_additional_data":false,"paper_date":"2023-02-10","paper":"/paper/scaling-vision-transformers-to-22-billion","paper_url":"https://arxiv.org/abs/2302.05442v1","paper_title":"Scaling Vision Transformers to 22 Billion Parameters","code":"https://github.com/lucidrains/flash-cosine-sim-attention","n_code_links":1,"syntology":null},{"rank_in_archive_order":16,"model":"InternImage-H","metrics":{"GFLOPs":"1478","Number of params":"1080M","Top 1 Accuracy":"89.6%"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"MaxViT-XL (512res, JFT)","metrics":{"Top 1 Accuracy":"89.53%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":18,"model":"AIMv2-3B (448 res)","metrics":{"Top 1 Accuracy":"89.5%"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":19,"model":"MAWS (ViT-H)","metrics":{"Number of params":"650M","Top 1 Accuracy":"89.5%"},"uses_additional_data":false,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":20,"model":"MaxViT-L (512res, JFT)","metrics":{"Top 1 Accuracy":"89.41%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":21,"model":"MaxViT-XL (384res, JFT)","metrics":{"Top 1 Accuracy":"89.36%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":22,"model":"OmniVec2","metrics":{"Top 1 Accuracy":"89.3%"},"uses_additional_data":false,"paper_date":"2024-01-01","paper":"/paper/omnivec2-a-novel-transformer-based-network","paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Srivastava_OmniVec2_-_A_Novel_Transformer_based_Network_for_Large_Scale_CVPR_2024_paper.html","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":23,"model":"NFNet-F4+","metrics":{"GFLOPs":"367","Number of params":"527M","Top 1 Accuracy":"89.2%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":24,"model":"MaxViT-L (384res, JFT)","metrics":{"Top 1 Accuracy":"89.12%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":25,"model":"MOAT-4 22K+1K","metrics":{"GFLOPs":"648.5","Number of params":"483.2M","Top 1 Accuracy":"89.1%"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":26,"model":"FD (CLIP ViT-L-336)","metrics":{"Number of params":"307M","Top 1 Accuracy":"89.0%"},"uses_additional_data":false,"paper_date":"2022-05-27","paper":"/paper/contrastive-learning-rivals-masked-image","paper_url":"https://arxiv.org/abs/2205.14141v3","paper_title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","code":"https://github.com/SwinTransformer/Feature-Distillation","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":8}},{"rank_in_archive_order":27,"model":"Last Layer Tuning with Newton Step (ViT-G/14))","metrics":{"Top 1 Accuracy":"88.9%"},"uses_additional_data":false,"paper_date":"2022-11-24","paper":"/paper/differentially-private-image-classification","paper_url":"https://arxiv.org/abs/2211.13403v1","paper_title":"Differentially Private Image Classification from Features","code":"https://github.com/google-research/google-research/tree/master/dp_transfer","n_code_links":1,"syntology":null},{"rank_in_archive_order":28,"model":"TokenLearner L/8 (24+11)","metrics":{"Number of params":"460M","Top 1 Accuracy":"88.87%"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_url":"https://arxiv.org/abs/2106.11297v4","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","code":"https://github.com/google-research/scenic","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":29,"model":"MaxViT-B (512res, JFT)","metrics":{"Top 1 Accuracy":"88.82%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":30,"model":"MAWS (ViT-L)","metrics":{"Top 1 Accuracy":"88.8%"},"uses_additional_data":false,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":31,"model":"MViTv2-H (512 res, ImageNet-21k pretrain)","metrics":{"GFLOPs":"763.5","Number of params":"667M","Top 1 Accuracy":"88.8%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":32,"model":"MaxViT-XL (512res, 21K)","metrics":{"Top 1 Accuracy":"88.7%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":33,"model":"MaxViT-B (384res, JFT)","metrics":{"Top 1 Accuracy":"88.69%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":34,"model":"ALIGN (EfficientNet-L2)","metrics":{"Number of params":"480M","Top 1 Accuracy":"88.64%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/scaling-up-visual-and-vision-language","paper_url":"https://arxiv.org/abs/2102.05918v2","paper_title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","code":"https://github.com/facebookresearch/metaclip","n_code_links":5,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":9}},{"rank_in_archive_order":35,"model":"EfficientNet-L2-475 (SAM)","metrics":{"Number of params":"480M","Top 1 Accuracy":"88.61%"},"uses_additional_data":false,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":36,"model":"ViT-B/16","metrics":{"Number of params":"86M","Top 1 Accuracy":"88.6%"},"uses_additional_data":false,"paper_date":"2023-02-10","paper":"/paper/scaling-vision-transformers-to-22-billion","paper_url":"https://arxiv.org/abs/2302.05442v1","paper_title":"Scaling Vision Transformers to 22 Billion Parameters","code":"https://github.com/lucidrains/flash-cosine-sim-attention","n_code_links":1,"syntology":null},{"rank_in_archive_order":37,"model":"BEiT-L (ViT; ImageNet-22K pretrain)","metrics":{"Number of params":"331M","Top 1 Accuracy":"88.60%"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":38,"model":"SWAG (ViT H/14)","metrics":{"GFLOPs":"1018.8","Number of params":"633.5M","Top 1 Accuracy":"88.6%"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/revisiting-weakly-supervised-pre-training-of","paper_url":"https://arxiv.org/abs/2201.08371v2","paper_title":"Revisiting Weakly Supervised Pre-Training of Visual Perception Models","code":"https://github.com/facebookresearch/SWAG","n_code_links":2,"syntology":null},{"rank_in_archive_order":39,"model":"ViT-H/14","metrics":{"Top 1 Accuracy":"88.55%"},"uses_additional_data":false,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":281,"n_unverified":138,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":40,"model":"CoAtNet-3 @384","metrics":{"GFLOPs":"114","Top 1 Accuracy":"88.52%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":41,"model":"MaxViT-XL (384res, 21K)","metrics":{"Top 1 Accuracy":"88.51%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":42,"model":"OpenCLIP ViT-H/14","metrics":{"Top 1 Accuracy":"88.5%"},"uses_additional_data":false,"paper_date":"2022-12-14","paper":"/paper/reproducible-scaling-laws-for-contrastive","paper_url":"https://arxiv.org/abs/2212.07143v2","paper_title":"Reproducible scaling laws for contrastive language-image learning","code":"https://github.com/mlfoundations/open_clip","n_code_links":5,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":43,"model":"AIMv2-3B","metrics":{"Top 1 Accuracy":"88.5%"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":44,"model":"FixEfficientNet-L2","metrics":{"GFLOPs":"585","Number of params":"480M","Top 1 Accuracy":"88.5%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":45,"model":"ViTAE-H + MAE (448)","metrics":{"Number of params":"644M","Top 1 Accuracy":"88.5%"},"uses_additional_data":false,"paper_date":"2022-02-21","paper":"/paper/vitaev2-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2202.10108v2","paper_title":"ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond","code":"https://github.com/ViTAE-Transformer/ViTDet","n_code_links":8,"syntology":{"n_ran":15,"n_unverified":10,"n_samples":25,"n_pointer_only_licence":2}},{"rank_in_archive_order":46,"model":"MaxViT-L (512res, 21K)","metrics":{"Top 1 Accuracy":"88.46%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":47,"model":"MViTv2-L (384 res, ImageNet-21k pretrain)","metrics":{"GFLOPs":"140.7","Number of params":"218M","Top 1 Accuracy":"88.4%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":48,"model":"NoisyStudent (EfficientNet-L2)","metrics":{"Hardware Burden":"51800G","Number of params":"480M","Top 1 Accuracy":"88.4%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":49,"model":"MaxViT-B (512res, 21K)","metrics":{"Top 1 Accuracy":"88.38%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":50,"model":"Top-k DiffSortNets (EfficientNet-L2)","metrics":{"Top 1 Accuracy":"88.37%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/differentiable-top-k-classification-learning-1","paper_url":"https://arxiv.org/abs/2206.07290v1","paper_title":"Differentiable Top-k Classification Learning","code":"https://github.com/felix-petersen/difftopk","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":51,"model":"Adlik-ViT-SG+Swin_large+Convnext_xlarge(384)","metrics":{"Number of params":"1827M","Top 1 Accuracy":"88.36%"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":52,"model":"V-MoE-H/14 (Every-2)","metrics":{"Number of params":"7200M","Top 1 Accuracy":"88.36%"},"uses_additional_data":false,"paper_date":"2021-06-10","paper":"/paper/scaling-vision-with-sparse-mixture-of-experts","paper_url":"https://arxiv.org/abs/2106.05974v1","paper_title":"Scaling Vision with Sparse Mixture of Experts","code":"https://github.com/google-research/vmoe","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":53,"model":"MaxViT-L (384res, 21K)","metrics":{"Top 1 Accuracy":"88.32%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":54,"model":"Unicom (ViT-L/14@336px) (Finetuned)","metrics":{"Top 1 Accuracy":"88.3"},"uses_additional_data":false,"paper_date":"2023-04-12","paper":"/paper/unicom-universal-and-compact-representation","paper_url":"https://arxiv.org/abs/2304.05884v1","paper_title":"Unicom: Universal and Compact Representation Learning for Image Retrieval","code":"https://github.com/OML-Team/open-metric-learning","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":55,"model":"PeCo (ViT-H, 448)","metrics":{"Top 1 Accuracy":"88.3%"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/peco-perceptual-codebook-for-bert-pre","paper_url":"https://arxiv.org/abs/2111.12710v3","paper_title":"PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers","code":"https://github.com/xyzforever/bevt","n_code_links":1,"syntology":null},{"rank_in_archive_order":56,"model":"DFN-5B H/14-378 + PrefixedIter Decoder","metrics":{"Top 1 Accuracy":"88.21%"},"uses_additional_data":false,"paper_date":"2024-07-15","paper":"/paper/unconstrained-open-vocabulary-image","paper_url":"https://arxiv.org/abs/2407.11211v4","paper_title":"Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion","code":"https://github.com/pallgeuer/novic","n_code_links":2,"syntology":null},{"rank_in_archive_order":57,"model":"dBOT ViT-H (CLIP as Teacher)","metrics":{"Top 1 Accuracy":"88.2%"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":58,"model":"MambaVision-L3","metrics":{"GFLOPs":"489.1","Top 1 Accuracy":"88.1%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":59,"model":"CAFormer-B36 (384 res, 21K)","metrics":{"GFLOPs":"72.2","Number of params":"99M","Top 1 Accuracy":"88.1%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":60,"model":"AIMv2-1B","metrics":{"Number of params":"1200M","Top 1 Accuracy":"88.1%"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":61,"model":"VIT-H/14","metrics":{"Number of params":"656M","Top 1 Accuracy":"88.08%"},"uses_additional_data":false,"paper_date":"2021-06-10","paper":"/paper/scaling-vision-with-sparse-mixture-of-experts","paper_url":"https://arxiv.org/abs/2106.05974v1","paper_title":"Scaling Vision with Sparse Mixture of Experts","code":"https://github.com/google-research/vmoe","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":62,"model":"ViT-H@224 (cosub)","metrics":{"Top 1 Accuracy":"88.0%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":63,"model":"UniRepLKNet-XL++","metrics":{"Top 1 Accuracy":"88%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":64,"model":"InternImage-XL","metrics":{"GFLOPs":"163","Number of params":"335M","Top 1 Accuracy":"88%"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":65,"model":"MViTv2-H (mageNet-21k pretrain)","metrics":{"GFLOPs":"120.6","Number of params":"667M","Top 1 Accuracy":"88%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":66,"model":"Mixer-H/14 (JFT-300M pre-train)","metrics":{"Top 1 Accuracy":"87.94%"},"uses_additional_data":false,"paper_date":"2021-05-04","paper":"/paper/mlp-mixer-an-all-mlp-architecture-for-vision","paper_url":"https://arxiv.org/abs/2105.01601v4","paper_title":"MLP-Mixer: An all-MLP Architecture for Vision","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":49,"syntology":{"n_ran":106,"n_unverified":28,"n_samples":134,"n_pointer_only_licence":36}},{"rank_in_archive_order":67,"model":"UniRepLKNet-L++","metrics":{"Top 1 Accuracy":"87.9%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":68,"model":"dBOT ViT-L (CLIP as Teacher)","metrics":{"Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":69,"model":"MogaNet-XL (384res)","metrics":{"GFLOPs":"102","Number of params":"181M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":70,"model":"VAN-B6 (22K, 384res)","metrics":{"GFLOPs":"114.3","Number of params":"200M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":71,"model":"RepLKNet-XL","metrics":{"GFLOPs":"128.7","Number of params":"335M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2022-03-13","paper":"/paper/scaling-up-your-kernels-to-31x31-revisiting","paper_url":"https://arxiv.org/abs/2203.06717v4","paper_title":"Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNs","code":"https://github.com/towhee-io/towhee","n_code_links":8,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":72,"model":"ConvNeXt-XL (ImageNet-22k)","metrics":{"GFLOPs":"179","Number of params":"350M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":73,"model":"MAE (ViT-H, 448)","metrics":{"Number of params":"656M","Top 1 Accuracy":"87.8%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":74,"model":"ViT-L/16","metrics":{"Top 1 Accuracy":"87.76%"},"uses_additional_data":false,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":281,"n_unverified":138,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":75,"model":"HorNet-L (GF)","metrics":{"GFLOPs":"101.8","Top 1 Accuracy":"87.7%"},"uses_additional_data":false,"paper_date":"2022-07-28","paper":"/paper/hornet-efficient-high-order-spatial","paper_url":"https://arxiv.org/abs/2207.14284v3","paper_title":"HorNet: Efficient High-Order Spatial Interactions with Recursive Gated Convolutions","code":"https://github.com/open-mmlab/mmclassification","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":76,"model":"CvT-W24 (384 res, ImageNet-22k pretrain)","metrics":{"Top 1 Accuracy":"87.7%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":77,"model":"InternImage-L","metrics":{"GFLOPs":"108","Number of params":"223M","Top 1 Accuracy":"87.7%"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":78,"model":"CoAtNet-3 (21k)","metrics":{"Top 1 Accuracy":"87.6%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":79,"model":"ConvFormer-B36 (384 res, 21K)","metrics":{"GFLOPs":"66.5","Number of params":"100M","Top 1 Accuracy":"87.6%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":80,"model":"BiT-L (ResNet)","metrics":{"Top 1 Accuracy":"87.54%","Top 5 Accuracy":"98.46"},"uses_additional_data":false,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":81,"model":"PeCo (ViT-H, 224)","metrics":{"Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2021-11-24","paper":"/paper/peco-perceptual-codebook-for-bert-pre","paper_url":"https://arxiv.org/abs/2111.12710v3","paper_title":"PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers","code":"https://github.com/xyzforever/bevt","n_code_links":1,"syntology":null},{"rank_in_archive_order":82,"model":"ViT-L@224 (cosub)","metrics":{"Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":83,"model":"CAFormer-M36 (384 res, 21K)","metrics":{"GFLOPs":"42","Number of params":"56M","Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":84,"model":"CSWin-L (384 res,ImageNet-22k pretrain)","metrics":{"GFLOPs":"96.8","Number of params":"173M","Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/cswin-transformer-a-general-vision","paper_url":"https://arxiv.org/abs/2107.00652v3","paper_title":"CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":85,"model":"DaViT-L (ImageNet-22k)","metrics":{"GFLOPs":"103","Number of params":"196.8M","Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":86,"model":"DiNAT-Large (11x11ks; 384res; Pretrained on IN22K@224)","metrics":{"GFLOPs":"92.4","Number of params":"200M","Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":87,"model":"AIMv2-H","metrics":{"Number of params":"600M","Top 1 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":88,"model":"V-MoE-L/16 (Every-2)","metrics":{"Number of params":"3400M","Top 1 Accuracy":"87.41%"},"uses_additional_data":false,"paper_date":"2021-06-10","paper":"/paper/scaling-vision-with-sparse-mixture-of-experts","paper_url":"https://arxiv.org/abs/2106.05974v1","paper_title":"Scaling Vision with Sparse Mixture of Experts","code":"https://github.com/google-research/vmoe","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":89,"model":"DiNAT-Large (384x384; Pretrained on ImageNet-22K @ 224x224)","metrics":{"GFLOPs":"89.7","Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":90,"model":"data2vec 2.0","metrics":{"Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2022-12-14","paper":"/paper/efficient-self-supervised-learning-with","paper_url":"https://arxiv.org/abs/2212.07525v2","paper_title":"Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language","code":"https://github.com/facebookresearch/fairseq/tree/main/examples/data2vec","n_code_links":5,"syntology":{"n_ran":5,"n_unverified":3,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":91,"model":"UniRepLKNet-B++","metrics":{"Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":92,"model":"HVT Huge","metrics":{"Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2024-09-25","paper":"/paper/hvt-a-comprehensive-vision-framework-for","paper_url":"https://arxiv.org/abs/2409.16897v2","paper_title":"HVT: A Comprehensive Vision Framework for Learning in Non-Euclidean Space","code":"https://github.com/hyperbolicvit/hyperbolicvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":93,"model":"CAFormer-B36 (224 res, 21K)","metrics":{"GFLOPs":"23.2","Number of params":"99M","Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":94,"model":"UniNet-B6","metrics":{"GFLOPs":"51","Number of params":"117M","Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/uninet-unified-architecture-search-with-1","paper_url":"https://arxiv.org/abs/2207.05420v2","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":"https://github.com/sense-x/tokenmix","n_code_links":2,"syntology":null},{"rank_in_archive_order":95,"model":"DiNAT_s-Large (384res; Pretrained on IN22K@224)","metrics":{"GFLOPs":"101.5","Number of params":"197M","Top 1 Accuracy":"87.4%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":96,"model":"Swin-L","metrics":{"GFLOPs":"103.9","Number of params":"197M","Top 1 Accuracy":"87.3%"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":97,"model":"EfficientNetV2-XL (21k)","metrics":{"GFLOPs":"94","Number of params":"208M","Top 1 Accuracy":"87.3%"},"uses_additional_data":true,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":98,"model":"VOLO-D5+HAT","metrics":{"GFLOPs":"412","Number of params":"295.5M","Top 1 Accuracy":"87.3%"},"uses_additional_data":false,"paper_date":"2022-04-03","paper":"/paper/improving-vision-transformers-by-revisiting","paper_url":"https://arxiv.org/abs/2204.00993v3","paper_title":"Improving Vision Transformers by Revisiting High-frequency Components","code":"https://github.com/jiawangbai/HAT","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":99,"model":"EfficientNetV2 (PolyLoss)","metrics":{"Top 1 Accuracy":"87.2%"},"uses_additional_data":true,"paper_date":"2022-04-26","paper":"/paper/polyloss-a-polynomial-expansion-perspective-1","paper_url":"https://arxiv.org/abs/2204.12511v2","paper_title":"PolyLoss: A Polynomial Expansion Perspective of Classification Loss Functions","code":"https://github.com/frgfm/Holocron","n_code_links":19,"syntology":{"n_ran":1,"n_unverified":6,"n_samples":7,"n_pointer_only_licence":1}},{"rank_in_archive_order":100,"model":"ELSA-VOLO-D5 (512*512)","metrics":{"GFLOPs":"437","Number of params":"298M","Top 1 Accuracy":"87.2%"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":101,"model":"Bamboo (Bamboo-H)","metrics":{"Top 1 Accuracy":"87.1"},"uses_additional_data":false,"paper_date":"2022-05-21","paper":"/paper/deeper-vs-wider-a-revisit-of-transformer","paper_url":"https://arxiv.org/abs/2205.10505v3","paper_title":"A Study on Transformer Configuration and Training Objective","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":102,"model":"Swin-L@224 (cosub)","metrics":{"Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":103,"model":"CoAtNet-2 (21k)","metrics":{"Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":104,"model":"FixEfficientNet-B7","metrics":{"GFLOPs":" 82","Number of params":"66M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":105,"model":"FAN-L-Hybrid++","metrics":{"Number of params":"76.8M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/understanding-the-robustness-in-vision","paper_url":"https://arxiv.org/abs/2204.12451v4","paper_title":"Understanding The Robustness in Vision Transformers","code":"https://github.com/nvlabs/fan","n_code_links":2,"syntology":null},{"rank_in_archive_order":106,"model":"SwinV2-B","metrics":{"Number of params":"88M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2021-11-18","paper":"/paper/swin-transformer-v2-scaling-up-capacity-and","paper_url":"https://arxiv.org/abs/2111.09883v2","paper_title":"Swin Transformer V2: Scaling Up Capacity and Resolution","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":23,"syntology":{"n_ran":3,"n_unverified":27,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":107,"model":"VOLO-D5","metrics":{"GFLOPs":"412","Number of params":"296M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":108,"model":"PatchConvNet-L120-21k-384","metrics":{"Number of params":"334.3M","Top 1 Accuracy":"87.1%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":109,"model":"16-TokenLearner B/16 (21)","metrics":{"Top 1 Accuracy":"87.07%"},"uses_additional_data":false,"paper_date":"2021-06-21","paper":"/paper/tokenlearner-what-can-8-learned-tokens-do-for","paper_url":"https://arxiv.org/abs/2106.11297v4","paper_title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","code":"https://github.com/google-research/scenic","n_code_links":11,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":110,"model":"MAE+DAT (ViT-H)","metrics":{"Top 1 Accuracy":"87.02%"},"uses_additional_data":false,"paper_date":"2022-09-16","paper":"/paper/enhance-the-visual-representation-via","paper_url":"https://arxiv.org/abs/2209.07735v1","paper_title":"Enhance the Visual Representation via Discrete Adversarial Training","code":"https://github.com/alibaba/easyrobust/tree/main/examples/imageclassification/imagenet/dat","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":1,"n_samples":11,"n_pointer_only_licence":1}},{"rank_in_archive_order":111,"model":"VAN-B5 (22K, 384res)","metrics":{"GFLOPs":"50.6","Top 1 Accuracy":"87%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":112,"model":"UniNet-B5","metrics":{"GFLOPs":"20.4","Number of params":"72.9M","Top 1 Accuracy":"87%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/uninet-unified-architecture-search-with-1","paper_url":"https://arxiv.org/abs/2207.05420v2","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":"https://github.com/sense-x/tokenmix","n_code_links":2,"syntology":null},{"rank_in_archive_order":113,"model":"ConvFormer-B36 (224 res, 21K)","metrics":{"GFLOPs":"22.6","Number of params":"100M","Top 1 Accuracy":"87.0%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":114,"model":"MAE (ViT-H)","metrics":{"Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":115,"model":"Hiera-H","metrics":{"Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":116,"model":"CAFormer-S36 (384 res, 21K)","metrics":{"GFLOPs":"26.0","Number of params":"39M","Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":117,"model":"ConvFormer-M36 (384 res, 21K)","metrics":{"GFLOPs":"37.7","Number of params":"57M","Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":118,"model":"NoisyStudent (EfficientNet-B7)","metrics":{"GFLOPs":"37","Number of params":"66M","Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":119,"model":"DaViT-B (ImageNet-22k)","metrics":{"GFLOPs":"46.4","Number of params":"87.9M","Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":120,"model":"VAN-B6 (22K)","metrics":{"GFLOPs":"38.9","Number of params":"200M","Top 1 Accuracy":"86.9%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":121,"model":"MAWS (ViT-B)","metrics":{"Top 1 Accuracy":"86.8%"},"uses_additional_data":false,"paper_date":"2023-03-23","paper":"/paper/the-effectiveness-of-mae-pre-pretraining-for","paper_url":"https://arxiv.org/abs/2303.13496v3","paper_title":"The effectiveness of MAE pre-pretraining for billion-scale pretraining","code":"https://github.com/facebookresearch/maws","n_code_links":1,"syntology":null},{"rank_in_archive_order":122,"model":"EfficientNetV2-L (21k)","metrics":{"GFLOPs":"53","Number of params":"120M","Top 1 Accuracy":"86.8%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":123,"model":"VOLO-D4","metrics":{"GFLOPs":"197","Number of params":"193M","Top 1 Accuracy":"86.8%"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":124,"model":"NFNet-F5 w/ SAM w/ augmult=16","metrics":{"Number of params":"377.2M","Top 1 Accuracy":"86.78%"},"uses_additional_data":false,"paper_date":"2021-05-27","paper":"/paper/drawing-multiple-augmentation-samples-per","paper_url":"https://arxiv.org/abs/2105.13343v2","paper_title":"Drawing Multiple Augmentation Samples Per Image During Training Efficiently Decreases Test Error","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":125,"model":"µ2Net (ViT-L/16)","metrics":{"Top 1 Accuracy":"86.74%"},"uses_additional_data":false,"paper_date":"2022-05-25","paper":"/paper/an-evolutionary-approach-to-dynamic","paper_url":"https://arxiv.org/abs/2205.12755v6","paper_title":"An Evolutionary Approach to Dynamic Introduction of Tasks in Large-scale Multitask Learning Systems","code":"https://github.com/google-research/google-research/tree/master/muNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":126,"model":"ViT-B @384 (DeiT III, 21k)","metrics":{"Top 1 Accuracy":"86.7%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":127,"model":"MaxViT-B (512res)","metrics":{"Top 1 Accuracy":"86.7%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":128,"model":"FixEfficientNet-B6","metrics":{"Number of params":"43M","Top 1 Accuracy":"86.7%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":129,"model":"MOAT-3 1K only","metrics":{"GFLOPs":"271","Number of params":"190M","Top 1 Accuracy":"86.7%"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":130,"model":"Heinsen Routing + BEiT-large 16 224","metrics":{"Number of params":"312.8M","Top 1 Accuracy":"86.7%"},"uses_additional_data":false,"paper_date":"2022-11-20","paper":"/paper/an-algorithm-for-routing-vectors-in-sequences","paper_url":"https://arxiv.org/abs/2211.11754v3","paper_title":"An Algorithm for Routing Vectors in Sequences","code":"https://github.com/glassroom/heinsen_routing","n_code_links":1,"syntology":null},{"rank_in_archive_order":131,"model":"CLCNet (S:ViT+D:EffNet-B7) (retrain)","metrics":{"GFLOPs":"51.93","Top 1 Accuracy":"86.61%"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/clcnet-rethinking-of-ensemble-modeling-with","paper_url":"https://arxiv.org/abs/2205.09612v5","paper_title":"CLCNet: Rethinking of Ensemble Modeling with Classification Confidence Network","code":"https://github.com/yaoching0/clcnet-rethinking-of-ensemble-modeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":132,"model":"CAFormer-M36 (224 res, 21K)","metrics":{"GFLOPs":"13.2","Number of params":"56M","Top 1 Accuracy":"86.6%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":133,"model":"VAN-B4 (22K, 384res)","metrics":{"GFLOPs":"35.9","Number of params":"60M","Top 1 Accuracy":"86.6%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":134,"model":"AIMv2-L","metrics":{"Number of params":"300M","Top 1 Accuracy":"86.6%"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":135,"model":"data2vec (ViT-H)","metrics":{"Number of params":"656M","Top 1 Accuracy":"86.6%"},"uses_additional_data":false,"paper_date":"2022-02-07","paper":"/paper/data2vec-a-general-framework-for-self-1","paper_url":"https://arxiv.org/abs/2202.03555v3","paper_title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","code":"https://github.com/huggingface/transformers/tree/main/src/transformers/models/data2vec","n_code_links":12,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":136,"model":"DiNAT_s-Large (224x224; Pretrained on ImageNet-22K @ 224x224)","metrics":{"GFLOPs":"34.5","Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":137,"model":"MKD ViT-L","metrics":{"Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/meta-knowledge-distillation","paper_url":"https://arxiv.org/abs/2202.07940v1","paper_title":"Meta Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":138,"model":"TinyViT-21M-512-distill (512 res, 21k)","metrics":{"GFLOPs":"27.0","Number of params":"21M","Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":139,"model":"PatchConvNet-B60-21k-384","metrics":{"Number of params":"99.4M","Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":140,"model":"CaiT-M-48-448","metrics":{"GFLOPs":"377.3","Number of params":"438M","Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":141,"model":"NFNet-F6 w/ SAM","metrics":{"GFLOPs":"377.28","Number of params":"438.4M","Top 1 Accuracy":"86.5%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":142,"model":"CLCNet (S:ViT+D:VOLO-D3) (retrain)","metrics":{"GFLOPs":"57.46","Top 1 Accuracy":"86.46%"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/clcnet-rethinking-of-ensemble-modeling-with","paper_url":"https://arxiv.org/abs/2205.09612v5","paper_title":"CLCNet: Rethinking of Ensemble Modeling with Classification Confidence Network","code":"https://github.com/yaoching0/clcnet-rethinking-of-ensemble-modeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":143,"model":"CLCNet (S:ConvNeXt-L+D:EffNet-B7) (retrain)","metrics":{"GFLOPs":"45.43","Top 1 Accuracy":"86.42%"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/clcnet-rethinking-of-ensemble-modeling-with","paper_url":"https://arxiv.org/abs/2205.09612v5","paper_title":"CLCNet: Rethinking of Ensemble Modeling with Classification Confidence Network","code":"https://github.com/yaoching0/clcnet-rethinking-of-ensemble-modeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":144,"model":"MaxViT-L (384res)","metrics":{"Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":145,"model":"UniRepLKNet-S++","metrics":{"Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":146,"model":"FixEfficientNet-B5","metrics":{"Number of params":"30M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":147,"model":"ConvFormer-S36 (384 res, 21K)","metrics":{"GFLOPs":"22.4","Number of params":"40M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":148,"model":"NoisyStudent (EfficientNet-B6)","metrics":{"Number of params":"43M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":149,"model":"Swin-B","metrics":{"GFLOPs":"47","Number of params":"88M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":150,"model":"CAFormer-B36 (384 res)","metrics":{"GFLOPs":"72.2","Number of params":"99M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":151,"model":"LV-ViT-L","metrics":{"GFLOPs":"214.8","Number of params":"151M","Top 1 Accuracy":"86.4%"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/token-labeling-training-a-85-5-top-1-accuracy","paper_url":"https://arxiv.org/abs/2104.10858v3","paper_title":"All Tokens Matter: Token Labeling for Training Better Vision Transformers","code":"https://github.com/zihangJiang/TokenLabeling","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":152,"model":"FixResNeXt-101 32x48d","metrics":{"Hardware Burden":"62G","Number of params":"829M","Top 1 Accuracy":"86.4%","Top 5 Accuracy":"98.0%"},"uses_additional_data":false,"paper_date":"2019-06-14","paper":"/paper/fixing-the-train-test-resolution-discrepancy","paper_url":"https://arxiv.org/abs/1906.06423v4","paper_title":"Fixing the train-test resolution discrepancy","code":"https://github.com/facebookresearch/FixRes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":153,"model":"MaxViT-B (384res)","metrics":{"Top 1 Accuracy":"86.34%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":154,"model":"Bamboo (Bamboo-L)","metrics":{"Top 1 Accuracy":"86.3"},"uses_additional_data":false,"paper_date":"2022-05-21","paper":"/paper/deeper-vs-wider-a-revisit-of-transformer","paper_url":"https://arxiv.org/abs/2205.10505v3","paper_title":"A Study on Transformer Configuration and Training Objective","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":155,"model":"ViT-B@224 (cosub)","metrics":{"Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":156,"model":"Our SP-ViT-L|384","metrics":{"Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":157,"model":"VOLO-D3","metrics":{"GFLOPs":"67.9","Number of params":"86M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":158,"model":"BEiT-L (ViT; ImageNet 1k pretrain)","metrics":{"Number of params":"86M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2021-06-15","paper":"/paper/beit-bert-pre-training-of-image-transformers","paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","code":"https://github.com/huggingface/transformers","n_code_links":14,"syntology":{"n_ran":6,"n_unverified":5,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":159,"model":"VAN-B5 (22K)","metrics":{"GFLOPs":"17.2","Number of params":"90M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":160,"model":"UniFormer-L (384 res)","metrics":{"GFLOPs":"39.2","Number of params":"100M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/uniformer-unifying-convolution-and-self","paper_url":"https://arxiv.org/abs/2201.09450v3","paper_title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":8,"syntology":null},{"rank_in_archive_order":161,"model":"MViTv2-L (384 res)","metrics":{"GFLOPs":"140.2","Number of params":"218M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":162,"model":"CAIT-M36-448","metrics":{"GFLOPs":"247.8","Number of params":"271M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":163,"model":"NFNet-F5 w/ SAM","metrics":{"GFLOPs":"289.76","Number of params":"377.2M","Top 1 Accuracy":"86.3%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":164,"model":"TinySaver(ConvNeXtV2_h, 0.01 Acc drop)","metrics":{"GFLOPs":"31.17","Top 1 Accuracy":"86.24"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/tiny-models-are-the-computational-saver-for","paper_url":"https://arxiv.org/abs/2403.17726v4","paper_title":"Tiny Models are the Computational Saver for Large Models","code":"https://github.com/QingyuanWang/tinysaver","n_code_links":1,"syntology":null},{"rank_in_archive_order":165,"model":"Swin-B@224 (cosub)","metrics":{"Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":166,"model":"TinyViT-21M-384-distill (384 res, 21k)","metrics":{"GFLOPs":"13.8","Number of params":"21M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":167,"model":"EfficientNetV2-M (21k)","metrics":{"GFLOPs":"24","Number of params":"54M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":168,"model":"CAFormer-M36 (384 res)","metrics":{"GFLOPs":"42.0","Number of params":"56M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":169,"model":"TransNeXt-Base (IN-1K supervised, 384)","metrics":{"GFLOPs":"56.3","Number of params":"89.7M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":170,"model":"MIRL (ViT-B-48)","metrics":{"GFLOPs":"67.0","Number of params":"341M","Top 1 Accuracy":"86.2%"},"uses_additional_data":false,"paper_date":"2023-09-25","paper":"/paper/masked-image-residual-learning-for-scaling-1","paper_url":"https://arxiv.org/abs/2309.14136v3","paper_title":"Masked Image Residual Learning for Scaling Deeper Vision Transformers","code":"https://github.com/russellllaputa/MIRL","n_code_links":1,"syntology":null},{"rank_in_archive_order":171,"model":"MaxViT-S (512res)","metrics":{"Top 1 Accuracy":"86.19%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":172,"model":"NoisyStudent (EfficientNet-B5)","metrics":{"Number of params":"30M","Top 1 Accuracy":"86.1%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":173,"model":"ConvFormer-M36 (224 res, 21K)","metrics":{"GFLOPs":"12.8","Number of params":"57M","Top 1 Accuracy":"86.1%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":174,"model":"CAIT-M-36","metrics":{"GFLOPs":"173.3","Number of params":"270.9M","Top 1 Accuracy":"86.1%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":175,"model":"Refiner-ViT-L","metrics":{"Number of params":"81M","Top 1 Accuracy":"86.03"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/refiner-refining-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2106.03714v1","paper_title":"Refiner: Refining Self-attention for Vision Transformers","code":"https://github.com/zhoudaquan/Refiner_ViT","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":176,"model":"GPaCo (ViT-L)","metrics":{"Top 1 Accuracy":"86.01%"},"uses_additional_data":false,"paper_date":"2022-09-26","paper":"/paper/generalized-parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2209.12400v2","paper_title":"Generalized Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":4,"syntology":null},{"rank_in_archive_order":177,"model":"Omnivore (Swin-L)","metrics":{"Top 1 Accuracy":"86.0%"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":178,"model":"Our SP-ViT-M|384","metrics":{"Top 1 Accuracy":"86%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":179,"model":"TransNeXt-Small (IN-1K supervised, 384)","metrics":{"GFLOPs":"32.1","Number of params":"49.7M","Top 1 Accuracy":"86.0%"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":180,"model":"VOLO-D2","metrics":{"Number of params":"59M","Top 1 Accuracy":"86%"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":181,"model":"EfficientViT-L2 (r384)","metrics":{"GFLOPs":"20","Number of params":"64M","Top 1 Accuracy":"86%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":182,"model":"XCiT-L24","metrics":{"GFLOPs":"417.9","Number of params":"189M","Top 1 Accuracy":"86%"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":183,"model":"SparK (ConvNeXt-Large, 384)","metrics":{"Number of params":"198M","Top 1 Accuracy":"86.0%"},"uses_additional_data":false,"paper_date":"2023-01-09","paper":"/paper/designing-bert-for-convolutional-networks","paper_url":"https://arxiv.org/abs/2301.03580v2","paper_title":"Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling","code":"https://github.com/keyu-tian/spark","n_code_links":2,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":184,"model":"NFNet-F5","metrics":{"GFLOPs":"289.76","Number of params":"377.2M","Top 1 Accuracy":"86.0%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":185,"model":"MAE (ViT-L)","metrics":{"Top 1 Accuracy":"85.9%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":186,"model":"FixEfficientNet-B4","metrics":{"Number of params":"19M","Top 1 Accuracy":"85.9%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":187,"model":"DAT-B++ (384x384)","metrics":{"GFLOPs":"49.7","Number of params":"94M","Top 1 Accuracy":"85.9%"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":188,"model":"NFNet-F4","metrics":{"GFLOPs":"215.24","Number of params":"316.1M","Top 1 Accuracy":"85.9%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":189,"model":"ConvNeXt-B@224 (cosub)","metrics":{"Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":190,"model":"PiT-B@224 (cosub)","metrics":{"Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":191,"model":"GTP-ViT-B-Patch8/P20","metrics":{"Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":192,"model":"CAFormer-S36 (224 res, 21K)","metrics":{"GFLOPs":"8.0","Number of params":"39M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":193,"model":"XCiT-M24","metrics":{"GFLOPs":"188","Number of params":"84M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":194,"model":"Fix-EfficientNet-B8 (MaxUp + CutMix)","metrics":{"Number of params":"87.42M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2020-02-20","paper":"/paper/maxup-a-simple-way-to-improve-generalization","paper_url":"https://arxiv.org/abs/2002.09024v1","paper_title":"MaxUp: A Simple Way to Improve Generalization of Neural Network Training","code":"https://github.com/Yunodo/maxup","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":195,"model":"KDforAA (EfficientNet-B8)","metrics":{"Number of params":"88M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2020-03-25","paper":"/paper/circumventing-outliers-of-autoaugment-with","paper_url":"https://arxiv.org/abs/2003.11342v1","paper_title":"Circumventing Outliers of AutoAugment with Knowledge Distillation","code":"https://github.com/chenyang4/resmooth","n_code_links":1,"syntology":null},{"rank_in_archive_order":196,"model":"CAIT-M-24","metrics":{"GFLOPs":"116.1","Number of params":"185.9M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":197,"model":"RDNet-L (384 res)","metrics":{"GFLOPs":"34.7","Number of params":"186M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":198,"model":"ViT-L","metrics":{"GFLOPs":"191.2","Number of params":"304.8M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":199,"model":"FasterViT-6","metrics":{"GFLOPs":"142","Number of params":"1360M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":200,"model":"SEER (RG-10B)","metrics":{"Number of params":"10000M","Top 1 Accuracy":"85.8%"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/vision-models-are-more-robust-and-fair-when","paper_url":"https://arxiv.org/abs/2202.08360v2","paper_title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","code":"https://github.com/facebookresearch/vissl","n_code_links":1,"syntology":null},{"rank_in_archive_order":201,"model":"TinySaver(ConvNeXtV2_h, 0.5 Acc drop)","metrics":{"GFLOPs":"19.41","Top 1 Accuracy":"85.75"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/tiny-models-are-the-computational-saver-for","paper_url":"https://arxiv.org/abs/2403.17726v4","paper_title":"Tiny Models are the Computational Saver for Large Models","code":"https://github.com/QingyuanWang/tinysaver","n_code_links":1,"syntology":null},{"rank_in_archive_order":202,"model":"TinySaver(Swin_large, 0.5 Acc drop)","metrics":{"Top 1 Accuracy":"85.74"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/tiny-models-are-the-computational-saver-for","paper_url":"https://arxiv.org/abs/2403.17726v4","paper_title":"Tiny Models are the Computational Saver for Large Models","code":"https://github.com/QingyuanWang/tinysaver","n_code_links":1,"syntology":null},{"rank_in_archive_order":203,"model":"MaxViT-T (384res)","metrics":{"Top 1 Accuracy":"85.72%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":204,"model":"VAN-B4 (22K)","metrics":{"GFLOPs":"12.2","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":205,"model":"EfficientNetV2-L","metrics":{"GFLOPs":"53","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":206,"model":"FixEfficientNet-B8","metrics":{"Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":207,"model":"ViT-B @224 (DeiT III, 21k)","metrics":{"Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":208,"model":"dBOT ViT-B (CLIP as Teacher)","metrics":{"Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2022-09-08","paper":"/paper/exploring-target-representations-for-masked","paper_url":"https://arxiv.org/abs/2209.03917v3","paper_title":"Exploring Target Representations for Masked Autoencoders","code":"https://github.com/liuxingbin/dbot","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":8,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":209,"model":"CAFormer-S36 (384 res)","metrics":{"GFLOPs":"26.0","Number of params":"39M","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":210,"model":"ConvFormer-B36 (384 res)","metrics":{"GFLOPs":"66.5","Number of params":"100M","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":211,"model":"NFNet-F3","metrics":{"GFLOPs":"114.76","Number of params":"254.9M","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":212,"model":"ViT-H @224 (DeiT-III + AugSub)","metrics":{"Number of params":"632M","Top 1 Accuracy":"85.7%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":213,"model":"XCiT-S24","metrics":{"GFLOPs":"106","Number of params":"48M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":214,"model":"ConvFormer-M36 (384 res)","metrics":{"GFLOPs":"37.7","Number of params":"57M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":215,"model":"EfficientViT-L2 (r288)","metrics":{"GFLOPs":"11","Number of params":"64M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":216,"model":"UniFormer-L","metrics":{"GFLOPs":"12.6","Number of params":"100M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/uniformer-unifying-convolution-and-self","paper_url":"https://arxiv.org/abs/2201.09450v3","paper_title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":8,"syntology":null},{"rank_in_archive_order":217,"model":"FasterViT-5","metrics":{"GFLOPs":"113","Number of params":"957.5M","Top 1 Accuracy":"85.6%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":218,"model":"ViT-L@384 (attn finetune)","metrics":{"Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":219,"model":"Our SP-ViT-L","metrics":{"Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":220,"model":"Mini-Swin-B@384","metrics":{"GFLOPs":"98.8","Number of params":"47M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/minivit-compressing-vision-transformers-with","paper_url":"https://arxiv.org/abs/2204.07154v1","paper_title":"MiniViT: Compressing Vision Transformers with Weight Multiplexing","code":"https://github.com/microsoft/AutoML","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":221,"model":"Wave-ViT-L","metrics":{"GFLOPs":"14.8","Number of params":"57.5M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-07-11","paper":"/paper/wave-vit-unifying-wavelet-and-transformers","paper_url":"https://arxiv.org/abs/2207.04978v1","paper_title":"Wave-ViT: Unifying Wavelet and Transformers for Visual Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":222,"model":"KDforAA (EfficientNet-B7)","metrics":{"Number of params":"66M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2020-03-25","paper":"/paper/circumventing-outliers-of-autoaugment-with","paper_url":"https://arxiv.org/abs/2003.11342v1","paper_title":"Circumventing Outliers of AutoAugment with Knowledge Distillation","code":"https://github.com/chenyang4/resmooth","n_code_links":1,"syntology":null},{"rank_in_archive_order":223,"model":"HaloNet4 (base 128, Conv-12)","metrics":{"Number of params":"87M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/scaling-local-self-attention-for-parameter","paper_url":"https://arxiv.org/abs/2103.12731v3","paper_title":"Scaling Local Self-Attention for Parameter Efficient Visual Backbones","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":8,"n_samples":20,"n_pointer_only_licence":0}},{"rank_in_archive_order":224,"model":"AdvProp (EfficientNet-B8)","metrics":{"Number of params":"88M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/adversarial-examples-improve-image","paper_url":"https://arxiv.org/abs/1911.09665v2","paper_title":"Adversarial Examples Improve Image Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":225,"model":"CAFormer-B36 (224 res)","metrics":{"GFLOPs":"23.2","Number of params":"99M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":226,"model":"ConvNeXt-L (384 res)","metrics":{"GFLOPs":"101","Number of params":"198M","Top 1 Accuracy":"85.5%"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":227,"model":"EfficientNet-B8 (RandAugment)","metrics":{"Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2019-09-30","paper":"/paper/randaugment-practical-data-augmentation-with","paper_url":"https://arxiv.org/abs/1909.13719v2","paper_title":"RandAugment: Practical automated data augmentation with a reduced search space","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":58,"n_unverified":7,"n_samples":65,"n_pointer_only_licence":17}},{"rank_in_archive_order":228,"model":"BiFormer-B* (IN1k ptretrain)","metrics":{"Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/biformer-vision-transformer-with-bi-level","paper_url":"https://arxiv.org/abs/2303.08810v1","paper_title":"BiFormer: Vision Transformer with Bi-Level Routing Attention","code":"https://github.com/rayleizhu/biformer","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":229,"model":"GTP-EVA-L/P8","metrics":{"Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":230,"model":"PatchConvNet-S60-21k-512","metrics":{"Number of params":"25.2M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":231,"model":"CAFormer-S18 (384 res, 21K)","metrics":{"GFLOPs":"13.4","Number of params":"26M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":232,"model":"ConvFormer-S36 (224 res, 21K)","metrics":{"GFLOPs":"7.6","Number of params":"40M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":233,"model":"ConvFormer-S36 (384 res)","metrics":{"GFLOPs":"22.4","Number of params":"40M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":234,"model":"CAIT-S-36","metrics":{"GFLOPs":"48","Number of params":"68.2M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":235,"model":"FasterViT-4","metrics":{"GFLOPs":"36.6","Number of params":"424.6M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":236,"model":"ResNeXt-101 32x48d","metrics":{"GFLOPs":"306","Number of params":"829M","Top 1 Accuracy":"85.4%"},"uses_additional_data":false,"paper_date":"2018-05-02","paper":"/paper/exploring-the-limits-of-weakly-supervised","paper_url":"http://arxiv.org/abs/1805.00932v1","paper_title":"Exploring the Limits of Weakly Supervised Pretraining","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":4,"syntology":null},{"rank_in_archive_order":237,"model":"BiT-M (ResNet)","metrics":{"Number of params":"928M","Top 1 Accuracy":"85.39%"},"uses_additional_data":false,"paper_date":"2019-12-24","paper":"/paper/large-scale-learning-of-general-visual","paper_url":"https://arxiv.org/abs/1912.11370v3","paper_title":"Big Transfer (BiT): General Visual Representation Learning","code":"https://github.com/google-research/big_transfer","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":7,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":238,"model":"ViT-L/16 Dosovitskiy et al. (2021)","metrics":{"Top 1 Accuracy":"85.3%"},"uses_additional_data":false,"paper_date":"2021-05-04","paper":"/paper/mlp-mixer-an-all-mlp-architecture-for-vision","paper_url":"https://arxiv.org/abs/2105.01601v4","paper_title":"MLP-Mixer: An all-MLP Architecture for Vision","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":49,"syntology":{"n_ran":106,"n_unverified":28,"n_samples":134,"n_pointer_only_licence":36}},{"rank_in_archive_order":239,"model":"Omnivore (Swin-B)","metrics":{"Top 1 Accuracy":"85.3%"},"uses_additional_data":false,"paper_date":"2022-01-20","paper":"/paper/omnivore-a-single-model-for-many-visual","paper_url":"https://arxiv.org/abs/2201.08377v2","paper_title":"Omnivore: A Single Model for Many Visual Modalities","code":"https://github.com/towhee-io/towhee","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":240,"model":"NoisyStudent (EfficientNet-B4)","metrics":{"Number of params":"19M","Top 1 Accuracy":"85.3%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":241,"model":"CAIT-S-48","metrics":{"GFLOPs":"63.8","Number of params":"89.5M","Top 1 Accuracy":"85.3%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":242,"model":"ViT-L @224 (DeiT-III + AugSub)","metrics":{"Number of params":"304M","Top 1 Accuracy":"85.3%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":243,"model":"CLCNet (S:D1+D:D5)","metrics":{"GFLOPs":"47.43","Top 1 Accuracy":"85.28%"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/clcnet-rethinking-of-ensemble-modeling-with","paper_url":"https://arxiv.org/abs/2205.09612v5","paper_title":"CLCNet: Rethinking of Ensemble Modeling with Classification Confidence Network","code":"https://github.com/yaoching0/clcnet-rethinking-of-ensemble-modeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":244,"model":"TinySaver(Swin_large, 1.0 Acc drop)","metrics":{"Top 1 Accuracy":"85.24"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/tiny-models-are-the-computational-saver-for","paper_url":"https://arxiv.org/abs/2403.17726v4","paper_title":"Tiny Models are the Computational Saver for Large Models","code":"https://github.com/QingyuanWang/tinysaver","n_code_links":1,"syntology":null},{"rank_in_archive_order":245,"model":"ViT-H @224 (DeiT III)","metrics":{"Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":246,"model":"HyenaPixel-Bidirectional-Former-B36","metrics":{"Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/hyenapixel-global-image-context-with","paper_url":"https://arxiv.org/abs/2402.19305v2","paper_title":"HyenaPixel: Global Image Context with Convolutions","code":"https://github.com/spravil/HyenaPixel","n_code_links":1,"syntology":null},{"rank_in_archive_order":247,"model":"VOLO-D1","metrics":{"Number of params":"27M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2021-06-24","paper":"/paper/volo-vision-outlooker-for-visual-recognition","paper_url":"https://arxiv.org/abs/2106.13112v2","paper_title":"VOLO: Vision Outlooker for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":248,"model":"CAFormer-M36 (224 res)","metrics":{"GFLOPs":"13.2","Number of params":"56M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":249,"model":"AdvProp (EfficientNet-B7)","metrics":{"Number of params":"66M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/adversarial-examples-improve-image","paper_url":"https://arxiv.org/abs/1911.09665v2","paper_title":"Adversarial Examples Improve Image Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":250,"model":"UniNet-B5","metrics":{"GFLOPs":"23.2","Number of params":"73.5M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2021-10-08","paper":"/paper/uninet-unified-architecture-search-with","paper_url":"https://arxiv.org/abs/2110.04035v1","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":251,"model":"DeiT-B 384","metrics":{"Number of params":"87M","Top 1 Accuracy":"85.2%"},"uses_additional_data":false,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":252,"model":"MaxViT-L (224res)","metrics":{"GFLOPs":"43.9","Number of params":"212M","Top 1 Accuracy":"85.17%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":253,"model":"EfficientNetV2-M","metrics":{"Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":254,"model":"MKD ViT-B","metrics":{"Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/meta-knowledge-distillation","paper_url":"https://arxiv.org/abs/2202.07940v1","paper_title":"Meta Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":255,"model":"SP-ViT-S|384","metrics":{"Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":256,"model":"XCiT-S12","metrics":{"GFLOPs":"55.6","Number of params":"26M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2021-06-17","paper":"/paper/xcit-cross-covariance-image-transformers","paper_url":"https://arxiv.org/abs/2106.09681v2","paper_title":"XCiT: Cross-Covariance Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":3,"n_unverified":11,"n_samples":14,"n_pointer_only_licence":3}},{"rank_in_archive_order":257,"model":"CAIT-S-24","metrics":{"GFLOPs":"32.2","Number of params":"46.9M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":258,"model":"ResNet200_vd_26w_4s_ssld","metrics":{"Number of params":"76M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2020-06-18","paper":"/paper/semi-supervised-recognition-under-a-noisy-and","paper_url":"https://arxiv.org/abs/2006.10702v1","paper_title":"Semi-Supervised Recognition under a Noisy and Fine-grained Dataset","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":1,"syntology":null},{"rank_in_archive_order":259,"model":"MixMIM-B","metrics":{"GFLOPs":"16.3","Number of params":"88M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/mixmim-mixed-and-masked-image-modeling-for","paper_url":"https://arxiv.org/abs/2205.13137v4","paper_title":"MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision Transformers","code":"https://github.com/sense-x/mixmim","n_code_links":1,"syntology":null},{"rank_in_archive_order":260,"model":"NFNet-F2","metrics":{"GFLOPs":"62.59","Number of params":"193.8M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":261,"model":"ResNeXt-101 32x32d","metrics":{"GFLOPs":"174","Number of params":"466M","Top 1 Accuracy":"85.1%"},"uses_additional_data":false,"paper_date":"2018-05-02","paper":"/paper/exploring-the-limits-of-weakly-supervised","paper_url":"http://arxiv.org/abs/1805.00932v1","paper_title":"Exploring the Limits of Weakly Supervised Pretraining","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":4,"syntology":null},{"rank_in_archive_order":262,"model":"DiscreteViT","metrics":{"Top 1 Accuracy":"85.07%"},"uses_additional_data":false,"paper_date":"2021-11-20","paper":"/paper/discrete-representations-strengthen-vision-1","paper_url":"https://arxiv.org/abs/2111.10493v2","paper_title":"Discrete Representations Strengthen Vision Transformer Robustness","code":"https://github.com/alibaba/easyrobust/tree/main/examples/imageclassification/imagenet/drvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":263,"model":"ViT-M@224 (cosub)","metrics":{"Top 1 Accuracy":"85.0%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":264,"model":"ViC-MAE (ViT-L)","metrics":{"Top 1 Accuracy":"85%"},"uses_additional_data":false,"paper_date":"2023-03-21","paper":"/paper/visual-representation-learning-from-unlabeled","paper_url":"https://arxiv.org/abs/2303.12001v3","paper_title":"ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders","code":"https://github.com/jeffhernandez1995/vic-mae","n_code_links":2,"syntology":null},{"rank_in_archive_order":265,"model":"HVT Large","metrics":{"Top 1 Accuracy":"85%"},"uses_additional_data":false,"paper_date":"2024-09-25","paper":"/paper/hvt-a-comprehensive-vision-framework-for","paper_url":"https://arxiv.org/abs/2409.16897v2","paper_title":"HVT: A Comprehensive Vision Framework for Learning in Non-Euclidean Space","code":"https://github.com/hyperbolicvit/hyperbolicvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":266,"model":"FixEfficientNet-B3","metrics":{"Number of params":"12M","Top 1 Accuracy":"85%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":267,"model":"CAFormer-S18 (384 res)","metrics":{"GFLOPs":"13.4","Number of params":"26M","Top 1 Accuracy":"85.0%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":268,"model":"ConvFormer-S18 (384 res, 21K)","metrics":{"GFLOPs":"11.6","Number of params":"27M","Top 1 Accuracy":"85.0%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":269,"model":"EfficientNet-B7 (RandAugment)","metrics":{"Number of params":"66M","Top 1 Accuracy":"85%"},"uses_additional_data":false,"paper_date":"2019-09-30","paper":"/paper/randaugment-practical-data-augmentation-with","paper_url":"https://arxiv.org/abs/1909.13719v2","paper_title":"RandAugment: Practical automated data augmentation with a reduced search space","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":58,"n_unverified":7,"n_samples":65,"n_pointer_only_licence":17}},{"rank_in_archive_order":270,"model":"ViT-B @384 (DeiT III)","metrics":{"Number of params":"87M","Top 1 Accuracy":"85.0%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":271,"model":"MambaVision-L","metrics":{"GFLOPs":"34.9","Number of params":"227.9M","Top 1 Accuracy":"85%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":272,"model":"MaxViT-B (224res)","metrics":{"GFLOPs":"23.4","Number of params":"120M","Top 1 Accuracy":"84.94%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":273,"model":"CaiT-S24","metrics":{"Top 1 Accuracy":"84.91%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":274,"model":"ViT-L @224 (DeiT III)","metrics":{"Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":275,"model":"Our SP-ViT-M","metrics":{"Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":276,"model":"FastViT-MA36","metrics":{"Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":277,"model":"HyenaPixel-Former-B36","metrics":{"Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/hyenapixel-global-image-context-with","paper_url":"https://arxiv.org/abs/2402.19305v2","paper_title":"HyenaPixel: Global Image Context with Convolutions","code":"https://github.com/spravil/HyenaPixel","n_code_links":1,"syntology":null},{"rank_in_archive_order":278,"model":"EfficientNetV2-S (21k)","metrics":{"GFLOPs":"8.8","Number of params":"22M","Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":279,"model":"CvT-21 (384 res, ImageNet-22k pretrain)","metrics":{"GFLOPs":"25","Number of params":"32M","Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":280,"model":"DAT-B++ (224x224)","metrics":{"GFLOPs":"16.6","Number of params":"93M","Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":281,"model":"InternImage-B","metrics":{"GFLOPs":"16","Number of params":"97M","Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":282,"model":"FasterViT-3","metrics":{"GFLOPs":"18.2","Number of params":"159.5M","Top 1 Accuracy":"84.9%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":283,"model":"TinyViT-21M-distill (21k)","metrics":{"GFLOPs":"4.3","Number of params":"21M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":284,"model":"Wave-ViT-B","metrics":{"GFLOPs":"7.2","Number of params":"33.5M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2022-07-11","paper":"/paper/wave-vit-unifying-wavelet-and-transformers","paper_url":"https://arxiv.org/abs/2207.04978v1","paper_title":"Wave-ViT: Unifying Wavelet and Transformers for Visual Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":285,"model":"CAIT-XS-36","metrics":{"GFLOPs":"28.8","Number of params":"38.6M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":286,"model":"SReT-B (384 res, ImageNet-1K only)","metrics":{"Number of params":"71.2M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/sliced-recursive-transformer-1","paper_url":"https://arxiv.org/abs/2111.05297v3","paper_title":"Sliced Recursive Transformer","code":"https://github.com/szq0214/sret","n_code_links":1,"syntology":null},{"rank_in_archive_order":287,"model":"MViT-B-24","metrics":{"GFLOPs":"32.7","Number of params":"72.9M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":288,"model":"ActiveMLP-L","metrics":{"GFLOPs":"36.4","Number of params":"76.4M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2022-03-11","paper":"/paper/activemlp-an-mlp-like-architecture-with","paper_url":"https://arxiv.org/abs/2203.06108v2","paper_title":"Active Token Mixer","code":"https://github.com/microsoft/TokenMixers","n_code_links":2,"syntology":null},{"rank_in_archive_order":289,"model":"DAT-B (384 res, IN-1K only)","metrics":{"GFLOPs":"49.8","Number of params":"88M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":290,"model":"MIRL(ViT-S-54)","metrics":{"GFLOPs":"18.8","Number of params":"96M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2023-09-25","paper":"/paper/masked-image-residual-learning-for-scaling-1","paper_url":"https://arxiv.org/abs/2309.14136v3","paper_title":"Masked Image Residual Learning for Scaling Deeper Vision Transformers","code":"https://github.com/russellllaputa/MIRL","n_code_links":1,"syntology":null},{"rank_in_archive_order":291,"model":"ConvFormer-B36 (224 res)","metrics":{"GFLOPs":"22.6","Number of params":"100M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":292,"model":"RDNet-L","metrics":{"GFLOPs":"34.7","Number of params":"186M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":293,"model":"ResNeXt-101 32x16d (semi-weakly sup.)","metrics":{"Number of params":"193M","Top 1 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2019-05-02","paper":"/paper/billion-scale-semi-supervised-learning-for","paper_url":"http://arxiv.org/abs/1905.00546v1","paper_title":"Billion-scale semi-supervised learning for image classification","code":"https://github.com/facebookresearch/semi-supervised-ImageNet1K-models","n_code_links":4,"syntology":null},{"rank_in_archive_order":294,"model":"ELSA-VOLO-D1","metrics":{"GFLOPs":"8","Number of params":"27M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":295,"model":"TransNeXt-Small (IN-1K supervised, 224)","metrics":{"GFLOPs":"10.3","Number of params":"49.7M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":296,"model":"Next-ViT-L @384","metrics":{"GFLOPs":"32","Number of params":"57.8M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/next-vit-next-generation-vision-transformer","paper_url":"https://arxiv.org/abs/2207.05501v4","paper_title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":297,"model":"VVT-L (384 res)","metrics":{"GFLOPs":"31.8","Number of params":"61.8M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2022-06-21","paper":"/paper/vicinity-vision-transformer","paper_url":"https://arxiv.org/abs/2206.10552v2","paper_title":"Vicinity Vision Transformer","code":"https://github.com/opennlplab/vicinity-vision-transformer","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":298,"model":"BoTNet T7","metrics":{"Number of params":"75.1M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":299,"model":"MogaNet-L","metrics":{"GFLOPs":"15.9","Number of params":"83M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":300,"model":"LITv2-B|384","metrics":{"GFLOPs":"39.7","Number of params":"87M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/fast-vision-transformers-with-hilo-attention","paper_url":"https://arxiv.org/abs/2205.13213v5","paper_title":"Fast Vision Transformers with HiLo Attention","code":"https://github.com/Westlake-AI/openmixup","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":301,"model":"NFNet-F1","metrics":{"GFLOPs":"35.54","Number of params":"132.6M","Top 1 Accuracy":"84.7%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":302,"model":"DAT-S++","metrics":{"GFLOPs":"9.4","Number of params":"53M","Top 1 Accuracy":"84.6%"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":303,"model":"Sequencer2D-L↑392","metrics":{"GFLOPs":"50.7","Number of params":"54M","Top 1 Accuracy":"84.6%"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/sequencer-deep-lstm-for-image-classification","paper_url":"https://arxiv.org/abs/2205.01972v4","paper_title":"Sequencer: Deep LSTM for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":304,"model":"SE-CoTNetD-152","metrics":{"GFLOPs":"26.5","Number of params":"55.8M","Top 1 Accuracy":"84.6%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/contextual-transformer-networks-for-visual","paper_url":"https://arxiv.org/abs/2107.12292v1","paper_title":"Contextual Transformer Networks for Visual Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":305,"model":"AMD(ViT-B/16)","metrics":{"Number of params":"87M","Top 1 Accuracy":"84.6%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":306,"model":"DaViT-B","metrics":{"GFLOPs":"15.5","Number of params":"87.9M","Top 1 Accuracy":"84.6%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":307,"model":"FastViT-SA36","metrics":{"Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":308,"model":"ReXNet-R_3.0","metrics":{"Number of params":"34.8M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":309,"model":"CAFormer-S36 (224 res)","metrics":{"GFLOPs":"8.0","Number of params":"39M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":310,"model":"EfficientViT-L1 (r224)","metrics":{"GFLOPs":"5.3","Number of params":"53M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":311,"model":"ConvFormer-M36 (224 res)","metrics":{"GFLOPs":"12.8","Number of params":"57M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":312,"model":"GC ViT-B","metrics":{"GFLOPs":"14.8","Number of params":"90M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":313,"model":"ResNeSt-269","metrics":{"Number of params":"111M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":314,"model":"CoAtNet-3","metrics":{"GFLOPs":"34.7","Number of params":"168M","Top 1 Accuracy":"84.5%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":315,"model":"MaxViT-S (224res)","metrics":{"GFLOPs":"11.7","Number of params":"69M","Top 1 Accuracy":"84.45%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":316,"model":"GPIPE","metrics":{"Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2018-11-16","paper":"/paper/gpipe-efficient-training-of-giant-neural","paper_url":"https://arxiv.org/abs/1811.06965v5","paper_title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","code":"https://github.com/tensorflow/lingvo","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":24,"n_samples":25,"n_pointer_only_licence":16}},{"rank_in_archive_order":317,"model":"DeBiFormer-B","metrics":{"Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2024-10-11","paper":"/paper/debiformer-vision-transformer-with-deformable","paper_url":"https://arxiv.org/abs/2410.08582v1","paper_title":"DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention","code":"https://github.com/maclong01/DeBiFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":318,"model":"ConvFormer-S18 (384 res)","metrics":{"GFLOPs":"11.6","Number of params":"27M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":319,"model":"EfficientNet-B7","metrics":{"GFLOPs":"37","Number of params":"66M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":320,"model":"RDNet-B","metrics":{"GFLOPs":"15.4","Number of params":"87M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":321,"model":"DiNAT-Base","metrics":{"GFLOPs":"13.7","Number of params":"90M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":322,"model":"ResNet-RS-50 (160 image res)","metrics":{"GFLOPs":"4.6","Number of params":"192M","Top 1 Accuracy":"84.4%"},"uses_additional_data":false,"paper_date":"2021-03-13","paper":"/paper/revisiting-resnets-improved-training-and","paper_url":"https://arxiv.org/abs/2103.07579v1","paper_title":"Revisiting ResNets: Improved Training and Scaling Strategies","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":323,"model":"ColorNet (RHYLH with Conv Layer)","metrics":{"Top 1 Accuracy":"84.32%"},"uses_additional_data":false,"paper_date":"2019-02-01","paper":"/paper/colornet-investigating-the-importance-of","paper_url":"http://arxiv.org/abs/1902.00267v1","paper_title":"ColorNet: Investigating the importance of color spaces for image classification","code":"https://github.com/kini5gowda/ColorNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":324,"model":"ViT-B@384 (attn finetune)","metrics":{"Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":325,"model":"BiFormer-S* (IN1k ptretrain)","metrics":{"Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/biformer-vision-transformer-with-bi-level","paper_url":"https://arxiv.org/abs/2303.08810v1","paper_title":"BiFormer: Vision Transformer with Bi-Level Routing Attention","code":"https://github.com/rayleizhu/biformer","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":326,"model":"SReT-S (512 res, ImageNet-1K only)","metrics":{"GFLOPs":"42.8","Number of params":"21.3M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/sliced-recursive-transformer-1","paper_url":"https://arxiv.org/abs/2111.05297v3","paper_title":"Sliced Recursive Transformer","code":"https://github.com/szq0214/sret","n_code_links":1,"syntology":null},{"rank_in_archive_order":327,"model":"LambdaResNet200","metrics":{"Number of params":"42M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2021-02-17","paper":"/paper/lambdanetworks-modeling-long-range-1","paper_url":"https://arxiv.org/abs/2102.08602v1","paper_title":"LambdaNetworks: Modeling Long-Range Interactions Without Attention","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":328,"model":"MogaNet-B","metrics":{"GFLOPs":"9.9","Number of params":"44M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":329,"model":"TResNet-XL","metrics":{"Number of params":"77M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/tresnet-high-performance-gpu-dedicated","paper_url":"https://arxiv.org/abs/2003.13630v3","paper_title":"TResNet: High Performance GPU-Dedicated Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":330,"model":"ResNeXt-101 32x8d (semi-weakly sup.)","metrics":{"Number of params":"88M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2019-05-02","paper":"/paper/billion-scale-semi-supervised-learning-for","paper_url":"http://arxiv.org/abs/1905.00546v1","paper_title":"Billion-scale semi-supervised learning for image classification","code":"https://github.com/facebookresearch/semi-supervised-ImageNet1K-models","n_code_links":4,"syntology":null},{"rank_in_archive_order":331,"model":"NAT-Base","metrics":{"GFLOPs":"13.7","Number of params":"90M","Top 1 Accuracy":"84.3%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":332,"model":"Assemble-ResNet152","metrics":{"GFLOPs":"15.8","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2020-01-17","paper":"/paper/compounding-the-performance-improvements-of","paper_url":"https://arxiv.org/abs/2001.06268v2","paper_title":"Compounding the Performance Improvements of Assembled Techniques in a Convolutional Neural Network","code":"https://github.com/clovaai/assembled-cnn","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":10,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":333,"model":"BoTNet T7-320","metrics":{"Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":334,"model":"ViP-B|384","metrics":{"Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2021-07-13","paper":"/paper/visual-parser-representing-part-whole","paper_url":"https://arxiv.org/abs/2107.05790v2","paper_title":"Visual Parser: Representing Part-whole Hierarchies with Transformers","code":"https://github.com/kevin-ssy/ViP","n_code_links":2,"syntology":null},{"rank_in_archive_order":335,"model":"Bamboo (Bamboo-B)","metrics":{"Top 1 Accuracy":"84.2"},"uses_additional_data":false,"paper_date":"2022-05-21","paper":"/paper/deeper-vs-wider-a-revisit-of-transformer","paper_url":"https://arxiv.org/abs/2205.10505v3","paper_title":"A Study on Transformer Configuration and Training Objective","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":336,"model":"RegnetY16GF@224 (cosub)","metrics":{"Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":337,"model":"EfficientViT-B3 (r288)","metrics":{"GFLOPs":"6.5","Number of params":"49M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":338,"model":"InternImage-S","metrics":{"GFLOPs":"8","Number of params":"50M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":339,"model":"UniNet-B4","metrics":{"GFLOPs":"9.9","Number of params":"73.5M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2021-10-08","paper":"/paper/uninet-unified-architecture-search-with","paper_url":"https://arxiv.org/abs/2110.04035v1","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":340,"model":"FasterViT-2","metrics":{"GFLOPs":"8.7","Number of params":"75.9M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":341,"model":"DeiT-B","metrics":{"Number of params":"86M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":342,"model":"ViT-B @224 (DeiT-III + AugSub)","metrics":{"Number of params":"86.6M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2023-06-20","paper":"/paper/augmenting-sub-model-to-improve-main-model","paper_url":"https://arxiv.org/abs/2306.11339v3","paper_title":"Masking meets Supervision: A Strong Learning Alliance","code":"https://github.com/naver-ai/augsub","n_code_links":1,"syntology":null},{"rank_in_archive_order":343,"model":"MambaVision-B","metrics":{"GFLOPs":"15","Number of params":"97.7M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":344,"model":"RevBiFPN-S6","metrics":{"GFLOPs":"38.1","Number of params":"142.3M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":345,"model":"ResNeXt-101 32×16d","metrics":{"GFLOPs":"72","Number of params":"194M","Top 1 Accuracy":"84.2%"},"uses_additional_data":false,"paper_date":"2018-05-02","paper":"/paper/exploring-the-limits-of-weakly-supervised","paper_url":"http://arxiv.org/abs/1805.00932v1","paper_title":"Exploring the Limits of Weakly Supervised Pretraining","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":4,"syntology":null},{"rank_in_archive_order":346,"model":"FBNetV5-F-CLS","metrics":{"GFLOPs":"2.1","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":347,"model":"ViT-B-36x1","metrics":{"Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":348,"model":"ViT-B-18x2","metrics":{"Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":349,"model":"XCiT-M (+MixPro)","metrics":{"Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":350,"model":"DGMMC-S","metrics":{"Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2024-10-17","paper":"/paper/performance-of-gaussian-mixture-model","paper_url":"https://arxiv.org/abs/2410.13421v1","paper_title":"Performance of Gaussian Mixture Model Classifiers on Embedded Feature Spaces","code":"https://github.com/cvmlmu/dgmmc","n_code_links":1,"syntology":null},{"rank_in_archive_order":351,"model":"NoisyStudent (EfficientNet-B3)","metrics":{"Number of params":"12M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":352,"model":"CAS-ViT-T","metrics":{"GFLOPs":"3.597","Number of params":"21.76M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2024-08-07","paper":"/paper/cas-vit-convolutional-additive-self-attention","paper_url":"https://arxiv.org/abs/2408.03703v2","paper_title":"CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications","code":"https://github.com/tianfang-zhang/cas-vit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":353,"model":"CAFormer-S18 (224 res, 21K)","metrics":{"GFLOPs":"4.1","Number of params":"26M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":354,"model":"CAIT-XS-24","metrics":{"GFLOPs":"19.3","Number of params":"26.6M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":355,"model":"ConvFormer-S36 (224 res)","metrics":{"GFLOPs":"7.6","Number of params":"40M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":356,"model":"LV-ViT-M","metrics":{"GFLOPs":"16","Number of params":"56M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/token-labeling-training-a-85-5-top-1-accuracy","paper_url":"https://arxiv.org/abs/2104.10858v3","paper_title":"All Tokens Matter: Token Labeling for Training Better Vision Transformers","code":"https://github.com/zihangJiang/TokenLabeling","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":357,"model":"VVT-L (224 res)","metrics":{"GFLOPs":"10.8","Number of params":"61.8M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2022-06-21","paper":"/paper/vicinity-vision-transformer","paper_url":"https://arxiv.org/abs/2206.10552v2","paper_title":"Vicinity Vision Transformer","code":"https://github.com/opennlplab/vicinity-vision-transformer","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":358,"model":"CoAtNet-2","metrics":{"GFLOPs":"15.7","Number of params":"75M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":359,"model":"Conformer-B","metrics":{"GFLOPs":"46.6","Number of params":"83.3M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-05-09","paper":"/paper/conformer-local-features-coupling-global","paper_url":"https://arxiv.org/abs/2105.03889v1","paper_title":"Conformer: Local Features Coupling Global Representations for Visual Recognition","code":"https://github.com/open-mmlab/mmclassification","n_code_links":4,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":360,"model":"PatchConvNet-B120","metrics":{"Number of params":"188.6M","Top 1 Accuracy":"84.1%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":361,"model":"GPaCo (Vit-B)","metrics":{"Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2022-09-26","paper":"/paper/generalized-parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2209.12400v2","paper_title":"Generalized Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":4,"syntology":null},{"rank_in_archive_order":362,"model":"AIM-7B","metrics":{"Top 1 Accuracy":"84.0"},"uses_additional_data":false,"paper_date":"2024-01-16","paper":"/paper/scalable-pre-training-of-large-autoregressive","paper_url":"https://arxiv.org/abs/2401.08541v1","paper_title":"Scalable Pre-training of Large Autoregressive Image Models","code":"https://github.com/lightly-ai/lightly","n_code_links":2,"syntology":null},{"rank_in_archive_order":363,"model":"FixEfficientNetB4","metrics":{"Number of params":"19M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":364,"model":"Fix_ResNet50_vd_ssld","metrics":{"Number of params":"25.58M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2020-06-18","paper":"/paper/semi-supervised-recognition-under-a-noisy-and","paper_url":"https://arxiv.org/abs/2006.10702v1","paper_title":"Semi-Supervised Recognition under a Noisy and Fine-grained Dataset","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":1,"syntology":null},{"rank_in_archive_order":365,"model":"TransNeXt-Tiny (IN-1K supervised, 224)","metrics":{"GFLOPs":"5.7","Number of params":"28.2M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":366,"model":"LambdaResNet152","metrics":{"Number of params":"35M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2021-02-17","paper":"/paper/lambdanetworks-modeling-long-range-1","paper_url":"https://arxiv.org/abs/2102.08602v1","paper_title":"LambdaNetworks: Modeling Long-Range Interactions Without Attention","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":7,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":367,"model":"EfficientNet-B6","metrics":{"GFLOPs":"19","Number of params":"43M","Top 1 Accuracy":"84%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":368,"model":"GC ViT-S","metrics":{"GFLOPs":"8.5","Number of params":"51M","Top 1 Accuracy":"84.0%"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":369,"model":"BoTNet T6","metrics":{"Number of params":"53.9M","Top 1 Accuracy":"84%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":370,"model":"PiT-B","metrics":{"GFLOPs":"12.5","Number of params":"73.8M","Top 1 Accuracy":"84%"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/rethinking-spatial-dimensions-of-vision","paper_url":"https://arxiv.org/abs/2103.16302v2","paper_title":"Rethinking Spatial Dimensions of Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":10,"n_unverified":10,"n_samples":20,"n_pointer_only_licence":0}},{"rank_in_archive_order":371,"model":"DeepMAD-89M","metrics":{"GFLOPs":"15.4","Number of params":"89M","Top 1 Accuracy":"84%"},"uses_additional_data":false,"paper_date":"2023-03-05","paper":"/paper/deepmad-mathematical-architecture-design-for","paper_url":"https://arxiv.org/abs/2303.02165v3","paper_title":"DeepMAD: Mathematical Architecture Design for Deep Convolutional Neural Network","code":"https://github.com/alibaba/lightweight-neural-architecture-search","n_code_links":1,"syntology":null},{"rank_in_archive_order":372,"model":"EfficientNetV2-S","metrics":{"Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2021-04-01","paper":"/paper/efficientnetv2-smaller-models-and-faster","paper_url":"https://arxiv.org/abs/2104.00298v3","paper_title":"EfficientNetV2: Smaller Models and Faster Training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":41,"n_unverified":38,"n_samples":79,"n_pointer_only_licence":10}},{"rank_in_archive_order":373,"model":"Our SP-ViT-S","metrics":{"Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2022-06-15","paper":"/paper/sp-vit-learning-2d-spatial-priors-for-vision","paper_url":"https://arxiv.org/abs/2206.07662v1","paper_title":"SP-ViT: Learning 2D Spatial Priors for Vision Transformers","code":"https://github.com/ZhouYuxuanYX/SP-ViT","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":374,"model":"UniRepLKNet-S","metrics":{"Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":375,"model":"DeBiFormer-S","metrics":{"Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2024-10-11","paper":"/paper/debiformer-vision-transformer-with-deformable","paper_url":"https://arxiv.org/abs/2410.08582v1","paper_title":"DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention","code":"https://github.com/maclong01/DeBiFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":376,"model":"Wave-ViT-S","metrics":{"GFLOPs":"4.7","Number of params":"22.7M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2022-07-11","paper":"/paper/wave-vit-unifying-wavelet-and-transformers","paper_url":"https://arxiv.org/abs/2207.04978v1","paper_title":"Wave-ViT: Unifying Wavelet and Transformers for Visual Representation Learning","code":"https://github.com/towhee-io/towhee","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":377,"model":"DAT-T++","metrics":{"GFLOPs":"4.3","Number of params":"24M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2023-09-04","paper":"/paper/dat-spatially-dynamic-vision-transformer-with","paper_url":"https://arxiv.org/abs/2309.01430v1","paper_title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":8,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":378,"model":"ASF-former-B","metrics":{"Number of params":"56.7M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/adaptive-split-fusion-transformer","paper_url":"https://arxiv.org/abs/2204.12196v2","paper_title":"Adaptive Split-Fusion Transformer","code":"https://github.com/szx503045266/asf-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":379,"model":"DynamicViT-LV-M/0.8","metrics":{"Number of params":"57.1M","Top 1 Accuracy":"83.9"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/dynamicvit-efficient-vision-transformers-with","paper_url":"https://arxiv.org/abs/2106.02034v2","paper_title":"DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification","code":"https://github.com/raoyongming/DynamicViT","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":3,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":380,"model":"TNT-B","metrics":{"Number of params":"65.6M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2021-02-27","paper":"/paper/transformer-in-transformer","paper_url":"https://arxiv.org/abs/2103.00112v3","paper_title":"Transformer in Transformer","code":"https://github.com/rwightman/pytorch-image-models/blob/master/timm/models/tnt.py","n_code_links":12,"syntology":{"n_ran":16,"n_unverified":8,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":381,"model":"ResNeSt-200","metrics":{"Number of params":"70M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":382,"model":"AmoebaNet-A","metrics":{"GFLOPs":"208","Number of params":"469M","Top 1 Accuracy":"83.9%"},"uses_additional_data":false,"paper_date":"2018-02-05","paper":"/paper/regularized-evolution-for-image-classifier","paper_url":"http://arxiv.org/abs/1802.01548v7","paper_title":"Regularized Evolution for Image Classifier Architecture Search","code":"https://github.com/tensorflow/tpu/tree/master/models/official/amoeba_net","n_code_links":5,"syntology":null},{"rank_in_archive_order":383,"model":"CLCNet (S:B4+D:B7)","metrics":{"GFLOPs":"18.58","Top 1 Accuracy":"83.88%"},"uses_additional_data":false,"paper_date":"2022-05-19","paper":"/paper/clcnet-rethinking-of-ensemble-modeling-with","paper_url":"https://arxiv.org/abs/2205.09612v5","paper_title":"CLCNet: Rethinking of Ensemble Modeling with Classification Confidence Network","code":"https://github.com/yaoching0/clcnet-rethinking-of-ensemble-modeling","n_code_links":1,"syntology":null},{"rank_in_archive_order":384,"model":"ResNet-RS-270 (256 image res)","metrics":{"GFLOPs":"54","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-03-13","paper":"/paper/revisiting-resnets-improved-training-and","paper_url":"https://arxiv.org/abs/2103.07579v1","paper_title":"Revisiting ResNets: Improved Training and Scaling Strategies","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":null},{"rank_in_archive_order":385,"model":"SENet-350","metrics":{"Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":386,"model":"ViT-B @224 (DeiT III)","metrics":{"Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":387,"model":"ColorMAE-Green-ViTB-1600","metrics":{"Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2024-07-17","paper":"/paper/colormae-exploring-data-independent-masking","paper_url":"https://arxiv.org/abs/2407.13036v1","paper_title":"ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders","code":"https://github.com/carlosh93/ColorMAE","n_code_links":1,"syntology":null},{"rank_in_archive_order":388,"model":"SReT-S (384 res, ImageNet-1K only)","metrics":{"GFLOPs":"18.5","Number of params":"21M","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/sliced-recursive-transformer-1","paper_url":"https://arxiv.org/abs/2111.05297v3","paper_title":"Sliced Recursive Transformer","code":"https://github.com/szq0214/sret","n_code_links":1,"syntology":null},{"rank_in_archive_order":389,"model":"DiNAT-Small","metrics":{"GFLOPs":"7.8","Number of params":"51M","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":390,"model":"Transformer local-attention (NesT-B)","metrics":{"GFLOPs":"17.9","Number of params":"68M","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-05-26","paper":"/paper/aggregating-nested-transformers","paper_url":"https://arxiv.org/abs/2105.12723v4","paper_title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":7,"n_unverified":19,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":391,"model":"PVTv2-B4","metrics":{"GFLOPs":"11.8","Number of params":"82M","Top 1 Accuracy":"83.8%"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":392,"model":"CA-Swin-S (+MixPro)","metrics":{"Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":393,"model":"GTP-ViT-L/P8","metrics":{"Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":394,"model":"ConvFormer-S18 (224 res, 21K)","metrics":{"GFLOPs":"3.9","Number of params":"27M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":395,"model":"RDNet-S","metrics":{"GFLOPs":"8.7","Number of params":"50M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":396,"model":"DAT-S","metrics":{"GFLOPs":"9.0","Number of params":"50M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":397,"model":"NAT-Small","metrics":{"GFLOPs":"7.8","Number of params":"51M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":398,"model":"QnA-ViT-Base","metrics":{"GFLOPs":"9.7","Number of params":"56M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/learned-queries-for-efficient-local-attention","paper_url":"https://arxiv.org/abs/2112.11435v2","paper_title":"Learned Queries for Efficient Local Attention","code":"https://github.com/moabarar/qna","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":399,"model":"RevBiFPN-S5","metrics":{"GFLOPs":"21.8","Number of params":"82M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":400,"model":"Pyramid ViG-B","metrics":{"GFLOPs":"16.8","Number of params":"92.6M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2022-06-01","paper":"/paper/vision-gnn-an-image-is-worth-graph-of-nodes","paper_url":"https://arxiv.org/abs/2206.00272v3","paper_title":"Vision GNN: An Image is Worth Graph of Nodes","code":"https://github.com/huawei-noah/efficient-ai-backbones","n_code_links":9,"syntology":{"n_ran":19,"n_unverified":15,"n_samples":34,"n_pointer_only_licence":22}},{"rank_in_archive_order":401,"model":"Twins-SVT-L","metrics":{"GFLOPs":"15.1","Number of params":"99.2M","Top 1 Accuracy":"83.7%"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/twins-revisiting-spatial-attention-design-in","paper_url":"https://arxiv.org/abs/2104.13840v4","paper_title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":402,"model":"TransBoost-ViT-S","metrics":{"Number of params":"22.05M","Top 1 Accuracy":"83.67%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":403,"model":"XCiT-S","metrics":{"Top 1 Accuracy":"83.65%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":404,"model":"MaxViT-T (224res)","metrics":{"GFLOPs":"5.6","Number of params":"31M","Top 1 Accuracy":"83.62%"},"uses_additional_data":false,"paper_date":"2022-04-04","paper":"/paper/maxvit-multi-axis-vision-transformer","paper_url":"https://arxiv.org/abs/2204.01697v4","paper_title":"MaxViT: Multi-Axis Vision Transformer","code":"https://github.com/huggingface/pytorch-image-models/blob/main/timm/models/maxxvit.py","n_code_links":15,"syntology":{"n_ran":33,"n_unverified":20,"n_samples":53,"n_pointer_only_licence":9}},{"rank_in_archive_order":405,"model":"Wave-ViT-S","metrics":{"Top 1 Accuracy":"83.61%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":406,"model":"LITv2-B","metrics":{"GFLOPs":"13.2","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/fast-vision-transformers-with-hilo-attention","paper_url":"https://arxiv.org/abs/2205.13213v5","paper_title":"Fast Vision Transformers with HiLo Attention","code":"https://github.com/Westlake-AI/openmixup","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":407,"model":"MultiGrain PNASNet (500px)","metrics":{"Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":408,"model":"MAE (ViT-L)","metrics":{"Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":409,"model":"PAT-B","metrics":{"Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2022-11-30","paper":"/paper/pattern-attention-transformer-with-doughnut","paper_url":"https://arxiv.org/abs/2211.16961v5","paper_title":"Pattern Attention Transformer with Doughnut Kernel","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":410,"model":"HyenaPixel-Attention-Former-S18","metrics":{"Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/hyenapixel-global-image-context-with","paper_url":"https://arxiv.org/abs/2402.19305v2","paper_title":"HyenaPixel: Global Image Context with Convolutions","code":"https://github.com/spravil/HyenaPixel","n_code_links":1,"syntology":null},{"rank_in_archive_order":411,"model":"FixEfficientNet-B2","metrics":{"Number of params":"9.2M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":412,"model":"CAFormer-S18 (224 res)","metrics":{"GFLOPs":"4.1","Number of params":"26M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":413,"model":"IPT-B","metrics":{"GFLOPs":"7.8","Number of params":"39.3M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/incepformer-efficient-inception-transformer","paper_url":"https://arxiv.org/abs/2212.03035v1","paper_title":"IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation","code":"https://github.com/shendu0321/incepformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":414,"model":"ViTAE-B-Stage","metrics":{"GFLOPs":"27.6","Number of params":"48.5M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":415,"model":"ResT-Large","metrics":{"GFLOPs":"7.9","Number of params":"51.63M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2021-05-28","paper":"/paper/rest-an-efficient-transformer-for-visual","paper_url":"https://arxiv.org/abs/2105.13677v5","paper_title":"ResT: An Efficient Transformer for Visual Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":416,"model":"NFNet-F0","metrics":{"GFLOPs":"12.38","Number of params":"71.5M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2021-02-11","paper":"/paper/high-performance-large-scale-image","paper_url":"https://arxiv.org/abs/2102.06171v1","paper_title":"High-Performance Large-Scale Image Recognition Without Normalization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":417,"model":"SE-ResNeXt-101, 64x4d, S=2(320px)","metrics":{"GFLOPs":"38.2","Number of params":"98M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":418,"model":"ResMLP-B24/8","metrics":{"Number of params":"116M","Top 1 Accuracy":"83.6%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":419,"model":"TinySaver(EfficientFormerV2_l, 0.01 Acc drop)","metrics":{"Top 1 Accuracy":"83.52"},"uses_additional_data":false,"paper_date":"2024-03-26","paper":"/paper/tiny-models-are-the-computational-saver-for","paper_url":"https://arxiv.org/abs/2403.17726v4","paper_title":"Tiny Models are the Computational Saver for Large Models","code":"https://github.com/QingyuanWang/tinysaver","n_code_links":1,"syntology":null},{"rank_in_archive_order":420,"model":"EfficientViT-B3 (r224)","metrics":{"GFLOPs":"4","Top 1 Accuracy":"83.5%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":421,"model":"BoTNet T5","metrics":{"GFLOPs":"19.3","Top 1 Accuracy":"83.5%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":422,"model":"HyenaPixel-Bidirectional-Former-S18","metrics":{"Top 1 Accuracy":"83.5%"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/hyenapixel-global-image-context-with","paper_url":"https://arxiv.org/abs/2402.19305v2","paper_title":"HyenaPixel: Global Image Context with Convolutions","code":"https://github.com/spravil/HyenaPixel","n_code_links":1,"syntology":null},{"rank_in_archive_order":423,"model":"PatchConvNet-B60","metrics":{"Number of params":"99.4M","Top 1 Accuracy":"83.5%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":424,"model":"SigLIP B/16 + PrefixedIter Decoder","metrics":{"Top 1 Accuracy":"83.46%"},"uses_additional_data":false,"paper_date":"2024-07-15","paper":"/paper/unconstrained-open-vocabulary-image","paper_url":"https://arxiv.org/abs/2407.11211v4","paper_title":"Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion","code":"https://github.com/pallgeuer/novic","n_code_links":2,"syntology":null},{"rank_in_archive_order":425,"model":"ViT-B (hMLP + BeiT)","metrics":{"Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":426,"model":"MNv4-Hybrid-L","metrics":{"Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/mobilenetv4-universal-models-for-the-mobile","paper_url":"https://arxiv.org/abs/2404.10518v2","paper_title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","code":"https://github.com/tensorflow/models/blob/master/official/vision/modeling/backbones/mobilenet.py","n_code_links":7,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":1}},{"rank_in_archive_order":427,"model":"UniFormer-S","metrics":{"GFLOPs":"3.6","Number of params":"22M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/uniformer-unifying-convolution-and-self","paper_url":"https://arxiv.org/abs/2201.09450v3","paper_title":"UniFormer: Unifying Convolution and Self-attention for Visual Recognition","code":"https://github.com/sithu31296/semantic-segmentation","n_code_links":8,"syntology":null},{"rank_in_archive_order":428,"model":"ViT-S @384 (DeiT III)","metrics":{"GFLOPs":"15.5","Number of params":"22M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":429,"model":"MogaNet-S","metrics":{"GFLOPs":"5","Number of params":"25M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":430,"model":"GC ViT-T","metrics":{"GFLOPs":"4.7","Number of params":"28M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":431,"model":"ResNeXt-101 32x4d (semi-weakly sup.)","metrics":{"Number of params":"42M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2019-05-02","paper":"/paper/billion-scale-semi-supervised-learning-for","paper_url":"http://arxiv.org/abs/1905.00546v1","paper_title":"Billion-scale semi-supervised learning for image classification","code":"https://github.com/facebookresearch/semi-supervised-ImageNet1K-models","n_code_links":4,"syntology":null},{"rank_in_archive_order":432,"model":"Sequencer2D-L","metrics":{"GFLOPs":"16.6","Number of params":"54M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/sequencer-deep-lstm-for-image-classification","paper_url":"https://arxiv.org/abs/2205.01972v4","paper_title":"Sequencer: Deep LSTM for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":433,"model":"sMLPNet-B (ImageNet-1k)","metrics":{"Number of params":"65.9M","Top 1 Accuracy":"83.4%"},"uses_additional_data":false,"paper_date":"2021-09-12","paper":"/paper/sparse-mlp-for-image-recognition-is-self","paper_url":"https://arxiv.org/abs/2109.05422v2","paper_title":"Sparse MLP for Image Recognition: Is Self-Attention Really Necessary?","code":"https://github.com/microsoft/SPACH","n_code_links":2,"syntology":null},{"rank_in_archive_order":434,"model":"SE-ResNeXt-101, 64x4d, S=2(416px)","metrics":{"GFLOPs":"61.1","Number of params":"98M","Top 1 Accuracy":"83.34%"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":435,"model":"CvT-21 (384 res)","metrics":{"GFLOPs":"24.9","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":436,"model":"T2T-ViT-14|384","metrics":{"GFLOPs":"34.2","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":437,"model":"CeiT-S (384 finetune res)","metrics":{"GFLOPs":"12.9","Number of params":"24.2M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":438,"model":"LV-ViT-S","metrics":{"GFLOPs":"6.6","Number of params":"26M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/token-labeling-training-a-85-5-top-1-accuracy","paper_url":"https://arxiv.org/abs/2104.10858v3","paper_title":"All Tokens Matter: Token Labeling for Training Better Vision Transformers","code":"https://github.com/zihangJiang/TokenLabeling","n_code_links":7,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":439,"model":"MOAT-0 1K only","metrics":{"GFLOPs":"5.7","Number of params":"27.8M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2022-10-04","paper":"/paper/moat-alternating-mobile-convolution-and","paper_url":"https://arxiv.org/abs/2210.01820v2","paper_title":"MOAT: Alternating Mobile Convolution and Attention Brings Strong Vision Models","code":"https://github.com/google-research/deeplab2","n_code_links":2,"syntology":null},{"rank_in_archive_order":440,"model":"EfficientNet-B5","metrics":{"GFLOPs":"9.9","Number of params":"30M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":441,"model":"Transformer local-attention (NesT-S)","metrics":{"GFLOPs":"10.4","Number of params":"38M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-05-26","paper":"/paper/aggregating-nested-transformers","paper_url":"https://arxiv.org/abs/2105.12723v4","paper_title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":7,"n_unverified":19,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":442,"model":"ViL-Medium-D","metrics":{"GFLOPs":"8.7","Number of params":"39.7M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":443,"model":"CoAtNet-1","metrics":{"GFLOPs":"8.4","Number of params":"42M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":444,"model":"LITv2-M","metrics":{"GFLOPs":"7.5","Number of params":"49M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/fast-vision-transformers-with-hilo-attention","paper_url":"https://arxiv.org/abs/2205.13213v5","paper_title":"Fast Vision Transformers with HiLo Attention","code":"https://github.com/Westlake-AI/openmixup","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":445,"model":"MambaVision-S","metrics":{"GFLOPs":"7.5","Number of params":"50.1M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":446,"model":"Shift-B","metrics":{"GFLOPs":"15.2","Number of params":"88M","Top 1 Accuracy":"83.3%"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":447,"model":"MultiGrain PNASNet (450px)","metrics":{"Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":448,"model":"Meta Pseudo Labels (ResNet-50)","metrics":{"Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2020-03-23","paper":"/paper/meta-pseudo-labels","paper_url":"https://arxiv.org/abs/2003.10580v4","paper_title":"Meta Pseudo Labels","code":"https://github.com/google-research/google-research/tree/master/meta_pseudo_labels","n_code_links":9,"syntology":{"n_ran":5,"n_unverified":9,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":449,"model":"UniRepLKNet-T","metrics":{"Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":450,"model":"HyenaPixel-Former-S18","metrics":{"Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2024-02-29","paper":"/paper/hyenapixel-global-image-context-with","paper_url":"https://arxiv.org/abs/2402.19305v2","paper_title":"HyenaPixel: Global Image Context with Convolutions","code":"https://github.com/spravil/HyenaPixel","n_code_links":1,"syntology":null},{"rank_in_archive_order":451,"model":"TinyViT-11M-distill (21k)","metrics":{"GFLOPs":"2.0","Number of params":"11M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":452,"model":"ReXNet-R_2.0","metrics":{"Number of params":"16.5M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":453,"model":"QnA-ViT-Small","metrics":{"GFLOPs":"4.4","Number of params":"25M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/learned-queries-for-efficient-local-attention","paper_url":"https://arxiv.org/abs/2112.11435v2","paper_title":"Learned Queries for Efficient Local Attention","code":"https://github.com/moabarar/qna","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":454,"model":"NAT-Tiny","metrics":{"GFLOPs":"4.3","Number of params":"28M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":455,"model":"SE-CoTNetD-101","metrics":{"GFLOPs":"8.5","Number of params":"40.9M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/contextual-transformer-networks-for-visual","paper_url":"https://arxiv.org/abs/2107.12292v1","paper_title":"Contextual Transformer Networks for Visual Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":456,"model":"Next-ViT-B","metrics":{"GFLOPs":"8.3","Number of params":"44.8M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/next-vit-next-generation-vision-transformer","paper_url":"https://arxiv.org/abs/2207.05501v4","paper_title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":457,"model":"PVTv2-B3","metrics":{"GFLOPs":"6.9","Number of params":"45.2M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":458,"model":"PatchConvNet-S120","metrics":{"Number of params":"47.7M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":459,"model":"FasterViT-1","metrics":{"GFLOPs":"5.3","Number of params":"53.4M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":460,"model":"ViL-Base-D","metrics":{"GFLOPs":"13.4","Number of params":"55.7M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":461,"model":"CycleMLP-B5","metrics":{"GFLOPs":"12.3","Number of params":"76M","Top 1 Accuracy":"83.2%"},"uses_additional_data":false,"paper_date":"2021-07-21","paper":"/paper/cyclemlp-a-mlp-like-architecture-for-dense","paper_url":"https://arxiv.org/abs/2107.10224v4","paper_title":"CycleMLP: A MLP-like Architecture for Dense Prediction","code":"https://github.com/BR-IDL/PaddleViT","n_code_links":8,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":1}},{"rank_in_archive_order":462,"model":"MultiGrain SENet154 (450px)","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":463,"model":"DeepVit-L* (DeiT training recipe)","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/deepvit-towards-deeper-vision-transformer","paper_url":"https://arxiv.org/abs/2103.11886v4","paper_title":"DeepViT: Towards Deeper Vision Transformer","code":"https://github.com/zhoudaquan/dvit_repo","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":464,"model":"ViT-S @224 (DeiT III, 21k)","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":465,"model":"MKD ViT-S","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/meta-knowledge-distillation","paper_url":"https://arxiv.org/abs/2202.07940v1","paper_title":"Meta Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":466,"model":"ViT-S@224 (cosub)","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/co-training-2-l-submodels-for-visual","paper_url":"https://arxiv.org/abs/2212.04884v1","paper_title":"Co-training $2^L$ Submodels for Visual Recognition","code":"https://github.com/facebookresearch/deit","n_code_links":1,"syntology":null},{"rank_in_archive_order":467,"model":"PAT-S","metrics":{"Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-11-30","paper":"/paper/pattern-attention-transformer-with-doughnut","paper_url":"https://arxiv.org/abs/2211.16961v5","paper_title":"Pattern Attention Transformer with Doughnut Kernel","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":468,"model":"TinyViT-21M","metrics":{"GFLOPs":"4.3","Number of params":"21M","Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":469,"model":"sMLPNet-S (ImageNet-1k)","metrics":{"Number of params":"48.6M","Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2021-09-12","paper":"/paper/sparse-mlp-for-image-recognition-is-self","paper_url":"https://arxiv.org/abs/2109.05422v2","paper_title":"Sparse MLP for Image Recognition: Is Self-Attention Really Necessary?","code":"https://github.com/microsoft/SPACH","n_code_links":2,"syntology":null},{"rank_in_archive_order":470,"model":"Pyramid ViG-M","metrics":{"GFLOPs":"8.9","Number of params":"51.7M","Top 1 Accuracy":"83.1%"},"uses_additional_data":false,"paper_date":"2022-06-01","paper":"/paper/vision-gnn-an-image-is-worth-graph-of-nodes","paper_url":"https://arxiv.org/abs/2206.00272v3","paper_title":"Vision GNN: An Image is Worth Graph of Nodes","code":"https://github.com/huawei-noah/efficient-ai-backbones","n_code_links":9,"syntology":{"n_ran":19,"n_unverified":15,"n_samples":34,"n_pointer_only_licence":22}},{"rank_in_archive_order":471,"model":"SwinV2-Ti","metrics":{"Top 1 Accuracy":"83.09%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":472,"model":"gSwin-S","metrics":{"GFLOPs":"7.0","Number of params":"39.8M","Top 1 Accuracy":"83.01%"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":473,"model":"MultiGrain SENet154 (400px)","metrics":{"Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":474,"model":"Swin-S + GFSA","metrics":{"Top 1 Accuracy":"83%"},"uses_additional_data":false,"paper_date":"2023-12-07","paper":"/paper/graph-convolutions-enrich-the-self-attention","paper_url":"https://arxiv.org/abs/2312.04234v5","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","code":"https://github.com/jeongwhanchoi/gfsa","n_code_links":1,"syntology":{"n_ran":19,"n_unverified":10,"n_samples":29,"n_pointer_only_licence":0}},{"rank_in_archive_order":475,"model":"CAS-ViT-M","metrics":{"GFLOPs":"1.887","Number of params":"12.42M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2024-08-07","paper":"/paper/cas-vit-convolutional-additive-self-attention","paper_url":"https://arxiv.org/abs/2408.03703v2","paper_title":"CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications","code":"https://github.com/tianfang-zhang/cas-vit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":476,"model":"CvT-13 (384 res)","metrics":{"GFLOPs":"16.3","Number of params":"20M","Top 1 Accuracy":"83%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":477,"model":"ResNet50_vd_ssld","metrics":{"Number of params":"25.58M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2020-06-18","paper":"/paper/semi-supervised-recognition-under-a-noisy-and","paper_url":"https://arxiv.org/abs/2006.10702v1","paper_title":"Semi-Supervised Recognition under a Noisy and Fine-grained Dataset","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":1,"syntology":null},{"rank_in_archive_order":478,"model":"ConvFormer-S18 (224 res)","metrics":{"GFLOPs":"3.9","Number of params":"27M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2022-10-24","paper":"/paper/metaformer-baselines-for-vision","paper_url":"https://arxiv.org/abs/2210.13452v4","paper_title":"MetaFormer Baselines for Vision","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":479,"model":"MViT-B-16","metrics":{"GFLOPs":"7.8","Number of params":"37M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2021-04-22","paper":"/paper/multiscale-vision-transformers","paper_url":"https://arxiv.org/abs/2104.11227v1","paper_title":"Multiscale Vision Transformers","code":"https://github.com/facebookresearch/SlowFast","n_code_links":8,"syntology":{"n_ran":13,"n_unverified":13,"n_samples":26,"n_pointer_only_licence":5}},{"rank_in_archive_order":480,"model":"ResNeSt-101","metrics":{"Number of params":"48M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":481,"model":"RevBiFPN-S4","metrics":{"GFLOPs":"10.6","Number of params":"48.7M","Top 1 Accuracy":"83%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":482,"model":"ZenNAS (0.8ms)","metrics":{"GFLOPs":"13.9","Number of params":"183M","Top 1 Accuracy":"83.0%"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/zen-nas-a-zero-shot-nas-for-high-performance","paper_url":"https://arxiv.org/abs/2102.01063v4","paper_title":"Zen-NAS: A Zero-Shot NAS for High-Performance Deep Image Recognition","code":"https://github.com/alibaba/lightweight-neural-architecture-search","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":483,"model":"NASViT (supernet)","metrics":{"GFLOPs":"1.881","Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":484,"model":"DeiT-B (+MixPro)","metrics":{"Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":485,"model":"MNv4-Conv-L","metrics":{"Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/mobilenetv4-universal-models-for-the-mobile","paper_url":"https://arxiv.org/abs/2404.10518v2","paper_title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","code":"https://github.com/tensorflow/models/blob/master/official/vision/modeling/backbones/mobilenet.py","n_code_links":7,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":1}},{"rank_in_archive_order":486,"model":"IPT-S","metrics":{"GFLOPs":"4.7","Number of params":"24.3M","Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/incepformer-efficient-inception-transformer","paper_url":"https://arxiv.org/abs/2212.03035v1","paper_title":"IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation","code":"https://github.com/shendu0321/incepformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":487,"model":"ViL-Medium-W","metrics":{"Number of params":"39.8M","Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":488,"model":"GFNet-H-B","metrics":{"GFLOPs":"8.6","Number of params":"54M","Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/global-filter-networks-for-image","paper_url":"https://arxiv.org/abs/2107.00645v2","paper_title":"Global Filter Networks for Image Classification","code":"https://github.com/raoyongming/GFNet","n_code_links":4,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":5}},{"rank_in_archive_order":489,"model":"Oct-ResNet-152 (SE)","metrics":{"GFLOPs":"22.2","Hardware Burden":"20771G","Number of params":"66.8M","Operations per network pass":"2.22G","Top 1 Accuracy":"82.9%"},"uses_additional_data":false,"paper_date":"2019-04-10","paper":"/paper/drop-an-octave-reducing-spatial-redundancy-in","paper_url":"https://arxiv.org/abs/1904.05049v3","paper_title":"Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks with Octave Convolution","code":"https://github.com/osmr/imgclsmob","n_code_links":28,"syntology":{"n_ran":14,"n_unverified":20,"n_samples":34,"n_pointer_only_licence":8}},{"rank_in_archive_order":490,"model":"PNASNet-5","metrics":{"GFLOPs":"50","Number of params":"86.1M","Operations per network pass":"2.5G","Top 1 Accuracy":"82.9%","Top 5 Accuracy":"96.2"},"uses_additional_data":false,"paper_date":"2017-12-02","paper":"/paper/progressive-neural-architecture-search","paper_url":"http://arxiv.org/abs/1712.00559v3","paper_title":"Progressive Neural Architecture Search","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":18,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":491,"model":"Harm-SE-RNX-101 64x4d (320x320, Mean-Max Pooling)","metrics":{"GFLOPs":"31.4","Number of params":"88.2M","Top 1 Accuracy":"82.85%"},"uses_additional_data":false,"paper_date":"2020-01-18","paper":"/paper/harmonic-convolutional-networks-based-on","paper_url":"https://arxiv.org/abs/2001.06570v3","paper_title":"Harmonic Convolutional Networks based on Discrete Cosine Transform","code":"https://github.com/matej-ulicny/harmonic-networks","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":10,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":492,"model":"GTP-LV-ViT-M/P8","metrics":{"GFLOPs":"8","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":493,"model":"FunMatch - T384+224 (ResNet-50)","metrics":{"Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/knowledge-distillation-a-good-teacher-is","paper_url":"https://arxiv.org/abs/2106.05237v2","paper_title":"Knowledge distillation: A good teacher is patient and consistent","code":"https://github.com/google-research/big_vision","n_code_links":10,"syntology":null},{"rank_in_archive_order":494,"model":"CA-Swin-T (+MixPro)","metrics":{"Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":495,"model":"CaiT-S + GFSA","metrics":{"Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2023-12-07","paper":"/paper/graph-convolutions-enrich-the-self-attention","paper_url":"https://arxiv.org/abs/2312.04234v5","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","code":"https://github.com/jeongwhanchoi/gfsa","n_code_links":1,"syntology":{"n_ran":19,"n_unverified":10,"n_samples":29,"n_pointer_only_licence":0}},{"rank_in_archive_order":496,"model":"RDNet-T","metrics":{"GFLOPs":"5.0","Number of params":"24M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2024-03-28","paper":"/paper/densenets-reloaded-paradigm-shift-beyond","paper_url":"https://arxiv.org/abs/2403.19588v2","paper_title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":497,"model":"VAN-B2","metrics":{"GFLOPs":"5","Number of params":"26.6M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":498,"model":"DaViT-T","metrics":{"Number of params":"28.3M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2022-04-07","paper":"/paper/davit-dual-attention-vision-transformers","paper_url":"https://arxiv.org/abs/2204.03645v1","paper_title":"DaViT: Dual Attention Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":8,"n_unverified":7,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":499,"model":"ReXNet_3.0","metrics":{"GFLOPs":"3.4","Number of params":"34.7M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":500,"model":"Sequencer2D-M","metrics":{"GFLOPs":"11.1","Number of params":"38M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/sequencer-deep-lstm-for-image-classification","paper_url":"https://arxiv.org/abs/2205.01972v4","paper_title":"Sequencer: Deep LSTM for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":501,"model":"CrossViT-18+","metrics":{"GFLOPs":"9.5","Number of params":"44.3M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2021-03-27","paper":"/paper/2103-14899","paper_url":"https://arxiv.org/abs/2103.14899v2","paper_title":"CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":17,"n_unverified":9,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":502,"model":"Shift-S","metrics":{"GFLOPs":"8.5","Number of params":"50M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":503,"model":"HRFormer-B","metrics":{"GFLOPs":"13.7","Number of params":"50.3M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2021-10-18","paper":"/paper/hrformer-high-resolution-transformer-for","paper_url":"https://arxiv.org/abs/2110.09408v3","paper_title":"HRFormer: High-Resolution Transformer for Dense Prediction","code":"https://github.com/HRNet/HRFormer","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":504,"model":"BoTNet T4","metrics":{"GFLOPs":"10.9","Number of params":"54.7M","Top 1 Accuracy":"82.8%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":505,"model":"KAT-B*","metrics":{"GFLOPs":"17.06","Number of params":"86.6M","Top 1 Accuracy":"82.8"},"uses_additional_data":false,"paper_date":"2024-09-16","paper":"/paper/kolmogorov-arnold-transformer","paper_url":"https://arxiv.org/abs/2409.10594v1","paper_title":"Kolmogorov-Arnold Transformer","code":"https://github.com/Adamdad/kat","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":506,"model":"MultiGrain SENet154 (500px)","metrics":{"Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":507,"model":"PVT-M (+MixPro)","metrics":{"Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":508,"model":"ASF-former-S","metrics":{"Number of params":"19.3M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2022-04-26","paper":"/paper/adaptive-split-fusion-transformer","paper_url":"https://arxiv.org/abs/2204.12196v2","paper_title":"Adaptive Split-Fusion Transformer","code":"https://github.com/szx503045266/asf-former","n_code_links":1,"syntology":null},{"rank_in_archive_order":509,"model":"Container Container","metrics":{"GFLOPs":"8.1","Number of params":"22.1M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2021-06-02","paper":"/paper/container-context-aggregation-network","paper_url":"https://arxiv.org/abs/2106.01401v2","paper_title":"Container: Context Aggregation Network","code":"https://github.com/allenai/container","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":510,"model":"UniNet-B2","metrics":{"GFLOPs":"2.4","Number of params":"22.5M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2021-10-08","paper":"/paper/uninet-unified-architecture-search-with","paper_url":"https://arxiv.org/abs/2110.04035v1","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":511,"model":"EfficientViT-B2 (r256)","metrics":{"GFLOPs":"2.1","Number of params":"24M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2022-05-29","paper":"/paper/efficientvit-enhanced-linear-attention-for","paper_url":"https://arxiv.org/abs/2205.14756v6","paper_title":"EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":512,"model":"DiNAT-Tiny","metrics":{"GFLOPs":"4.3","Number of params":"28M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":513,"model":"ELSA-Swin-T","metrics":{"GFLOPs":"4.8","Number of params":"28M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2021-12-23","paper":"/paper/elsa-enhanced-local-self-attention-for-vision","paper_url":"https://arxiv.org/abs/2112.12786v1","paper_title":"ELSA: Enhanced Local Self-Attention for Vision Transformer","code":"https://github.com/damo-cv/elsa","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":514,"model":"MambaVision-T2","metrics":{"GFLOPs":"5.1","Number of params":"35.1M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":515,"model":"NASNET-A(6)","metrics":{"GFLOPs":"23.8","Hardware Burden":"1648G","Number of params":"88.9M","Operations per network pass":"2.38G","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2017-07-21","paper":"/paper/learning-transferable-architectures-for","paper_url":"http://arxiv.org/abs/1707.07012v4","paper_title":"Learning Transferable Architectures for Scalable Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/slim","n_code_links":17,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":516,"model":"RVT-B*","metrics":{"GFLOPs":"17.7","Number of params":"91.8M","Top 1 Accuracy":"82.7%"},"uses_additional_data":false,"paper_date":"2021-05-17","paper":"/paper/rethinking-the-design-principles-of-robust","paper_url":"https://arxiv.org/abs/2105.07926v4","paper_title":"Towards Robust Vision Transformer","code":"https://github.com/alibaba/easyrobust","n_code_links":2,"syntology":null},{"rank_in_archive_order":517,"model":"CMA(ViT-B/16)","metrics":{"Top 1 Accuracy":"82.64%"},"uses_additional_data":false,"paper_date":"2025-03-24","paper":"/paper/enhanced-ood-detection-through-cross-modal","paper_url":"https://arxiv.org/abs/2503.18817v1","paper_title":"Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations","code":"https://github.com/ma-kjh/CMA-OoDD","n_code_links":1,"syntology":null},{"rank_in_archive_order":518,"model":"FBNetV5-C-CLS","metrics":{"GFLOPs":"1","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":519,"model":"MultiGrain PNASNet (400px)","metrics":{"Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":520,"model":"ViT-S-24x2","metrics":{"Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":521,"model":"FastViT-SA24","metrics":{"Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":522,"model":"FixEfficientNet-B1","metrics":{"Number of params":"7.8M","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":523,"model":"EfficientNet-B4","metrics":{"GFLOPs":"4.2","Number of params":"19M","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":524,"model":"DeiT-B","metrics":{"Number of params":"22M","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":525,"model":"T2T-ViTt-24","metrics":{"GFLOPs":"30","Number of params":"64.4M","Top 1 Accuracy":"82.6%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":526,"model":"ViT-S","metrics":{"Top 1 Accuracy":"82.54%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":527,"model":"CvT-21","metrics":{"GFLOPs":"7.1","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":528,"model":"TransNeXt-Micro (IN-1K supervised, 224)","metrics":{"GFLOPs":"2.7","Number of params":"12.8M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2023-11-28","paper":"/paper/transnext-robust-foveal-visual-perception-for","paper_url":"https://arxiv.org/abs/2311.17132v3","paper_title":"TransNeXt: Robust Foveal Visual Perception for Vision Transformers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":4,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":529,"model":"FixResNet-50 Billion-scale@224","metrics":{"Number of params":"25.6M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2019-06-14","paper":"/paper/fixing-the-train-test-resolution-discrepancy","paper_url":"https://arxiv.org/abs/1906.06423v4","paper_title":"Fixing the train-test resolution discrepancy","code":"https://github.com/facebookresearch/FixRes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":530,"model":"Next-ViT-S","metrics":{"GFLOPs":"5.8","Number of params":"31.7M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/next-vit-next-generation-vision-transformer","paper_url":"https://arxiv.org/abs/2207.05501v4","paper_title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":531,"model":"LeViT-384","metrics":{"GFLOPs":"2.334","Number of params":"39.4M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":532,"model":"CrossViT-18","metrics":{"GFLOPs":"9","Number of params":"43.3M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2021-03-27","paper":"/paper/2103-14899","paper_url":"https://arxiv.org/abs/2103.14899v2","paper_title":"CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":17,"n_unverified":9,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":533,"model":"MetaFormer PoolFormer-M48","metrics":{"GFLOPs":"23.2","Number of params":"73M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2021-11-22","paper":"/paper/metaformer-is-actually-what-you-need-for","paper_url":"https://arxiv.org/abs/2111.11418v3","paper_title":"MetaFormer Is Actually What You Need for Vision","code":"https://github.com/huggingface/transformers","n_code_links":18,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":534,"model":"ConViT-B+","metrics":{"GFLOPs":"30","Number of params":"152M","Top 1 Accuracy":"82.5%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":535,"model":"TransBoost-ConvNext-T","metrics":{"Number of params":"28.59M","Top 1 Accuracy":"82.46%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":536,"model":"ReViT-B","metrics":{"Top 1 Accuracy":"82.4"},"uses_additional_data":false,"paper_date":"2024-02-17","paper":"/paper/revit-enhancing-vision-transformers-with","paper_url":"https://arxiv.org/abs/2402.11301v2","paper_title":"ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections","code":"https://github.com/adiko1997/revit","n_code_links":1,"syntology":{"n_ran":22,"n_unverified":2,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":537,"model":"M2D-T","metrics":{"Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2024-12-20","paper":"/paper/mamba2d-a-natively-multi-dimensional-state","paper_url":"https://arxiv.org/abs/2412.16146v2","paper_title":"Mamba2D: A Natively Multi-Dimensional State-Space Model for Vision Tasks","code":"https://github.com/cocoalex00/Mamba2D","n_code_links":1,"syntology":null},{"rank_in_archive_order":538,"model":"NoisyStudent (EfficientNet-B2)","metrics":{"Number of params":"9.2M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":539,"model":"AutoFormer-base","metrics":{"GFLOPs":"11","Number of params":"54M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/autoformer-searching-transformers-for-visual","paper_url":"https://arxiv.org/abs/2107.00651v1","paper_title":"AutoFormer: Searching Transformers for Visual Recognition","code":"https://github.com/microsoft/AutoML","n_code_links":2,"syntology":null},{"rank_in_archive_order":540,"model":"ResNet-152 (A2 + reg)","metrics":{"Number of params":"60.2M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":541,"model":"ConViT-B","metrics":{"GFLOPs":"17","Number of params":"86M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":542,"model":"DeiT-B with iRPE-K","metrics":{"GFLOPs":"35.368","Number of params":"87M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":543,"model":"Mega","metrics":{"Number of params":"90M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2022-09-21","paper":"/paper/mega-moving-average-equipped-gated-attention","paper_url":"https://arxiv.org/abs/2209.10655v3","paper_title":"Mega: Moving Average Equipped Gated Attention","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":1,"n_samples":13,"n_pointer_only_licence":8}},{"rank_in_archive_order":544,"model":"ResMLP-B24 + STD","metrics":{"GFLOPs":"24.1","Number of params":"122.6M","Top 1 Accuracy":"82.4%"},"uses_additional_data":false,"paper_date":"2022-07-23","paper":"/paper/spatial-channel-token-distillation-for-vision","paper_url":"https://proceedings.mlr.press/v162/li22c.html","paper_title":"Spatial-Channel Token Distillation for Vision MLPs","code":"https://github.com/devrimcavusoglu/std","n_code_links":1,"syntology":null},{"rank_in_archive_order":545,"model":"ViT-B/16-224+HTM","metrics":{"Top 1 Accuracy":"82.37%"},"uses_additional_data":false,"paper_date":"2022-10-14","paper":"/paper/tokenmixup-efficient-attention-guided-token","paper_url":"https://arxiv.org/abs/2210.07562v1","paper_title":"TokenMixup: Efficient Attention-guided Token-level Data Augmentation for Transformers","code":"https://github.com/mlvlab/tokenmixup","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":546,"model":"ColorNet","metrics":{"Top 1 Accuracy":"82.35%"},"uses_additional_data":false,"paper_date":"2019-02-01","paper":"/paper/colornet-investigating-the-importance-of","paper_url":"http://arxiv.org/abs/1902.00267v1","paper_title":"ColorNet: Investigating the importance of color spaces for image classification","code":"https://github.com/kini5gowda/ColorNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":547,"model":"ConvNeXt-T-Hermite","metrics":{"Number of params":"28M","Top 1 Accuracy":"82.34","Top 5 Accuracy":"96.03"},"uses_additional_data":false,"paper_date":"2025-02-03","paper":"/paper/learnable-polynomial-trigonometric-and","paper_url":"https://arxiv.org/abs/2502.01247v2","paper_title":"Polynomial, trigonometric, and tropical activations","code":"https://github.com/K-H-Ismail/torchortho","n_code_links":1,"syntology":null},{"rank_in_archive_order":548,"model":"T2T-ViT-24","metrics":{"GFLOPs":"27.6","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":549,"model":"ViT-S-48x1","metrics":{"Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2022-03-18","paper":"/paper/three-things-everyone-should-know-about","paper_url":"https://arxiv.org/abs/2203.09795v1","paper_title":"Three things everyone should know about Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":550,"model":"MViTv2-T","metrics":{"GFLOPs":"4.7","Number of params":"24M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/improved-multiscale-vision-transformers-for","paper_url":"https://arxiv.org/abs/2112.01526v2","paper_title":"MViTv2: Improved Multiscale Vision Transformers for Classification and Detection","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":551,"model":"SCARLET-A4","metrics":{"GFLOPs":"8.4","Hardware Burden":"12G","Number of params":"27.8M","Operations per network pass":"0.42G","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2019-08-16","paper":"/paper/scarletnas-bridging-the-gap-between","paper_url":"https://arxiv.org/abs/1908.06022v6","paper_title":"SCARLET-NAS: Bridging the Gap between Stability and Scalability in Weight-sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/SCARLET-NAS","n_code_links":1,"syntology":null},{"rank_in_archive_order":552,"model":"Sequencer2D-S","metrics":{"GFLOPs":"8.4","Number of params":"28M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2022-05-04","paper":"/paper/sequencer-deep-lstm-for-image-classification","paper_url":"https://arxiv.org/abs/2205.01972v4","paper_title":"Sequencer: Deep LSTM for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":553,"model":"CrossViT-15+","metrics":{"GFLOPs":"6.1","Number of params":"28.2M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2021-03-27","paper":"/paper/2103-14899","paper_url":"https://arxiv.org/abs/2103.14899v2","paper_title":"CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":17,"n_unverified":9,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":554,"model":"MambaVision-T","metrics":{"GFLOPs":"4.4","Number of params":"31.8M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":555,"model":"GLiT-Bases","metrics":{"GFLOPs":"17","Number of params":"96.1M","Top 1 Accuracy":"82.3%"},"uses_additional_data":false,"paper_date":"2021-07-07","paper":"/paper/glit-neural-architecture-search-for-global","paper_url":"https://arxiv.org/abs/2107.02960v3","paper_title":"GLiT: Neural Architecture Search for Global and Local Image Transformer","code":"https://github.com/lpxtt/simtrack","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":556,"model":"EViT (delete)","metrics":{"Top 1 Accuracy":"82.29%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":557,"model":"STViT-Swin-Ti","metrics":{"Top 1 Accuracy":"82.22%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":558,"model":"BossNet-T1","metrics":{"GFLOPs":"15.8","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/bossnas-exploring-hybrid-cnn-transformers","paper_url":"https://arxiv.org/abs/2103.12424v3","paper_title":"BossNAS: Exploring Hybrid CNN-transformers with Block-wisely Self-supervised Neural Architecture Search","code":"https://github.com/changlin31/BossNAS","n_code_links":1,"syntology":null},{"rank_in_archive_order":559,"model":"CAIT-XXS-36","metrics":{"GFLOPs":"14.3","Number of params":"17.3M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":560,"model":"CvT-13-NAS","metrics":{"GFLOPs":"4.1","Number of params":"18M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":561,"model":"ViTAE-S-Stage","metrics":{"GFLOPs":"12.0","Number of params":"19.2M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":562,"model":"T2T-ViTt-19","metrics":{"GFLOPs":"19.6","Number of params":"39.2M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":563,"model":"Evo-LeViT-384*","metrics":{"Number of params":"39.6M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-08-03","paper":"/paper/evo-vit-slow-fast-token-evolution-for-dynamic","paper_url":"https://arxiv.org/abs/2108.01390v5","paper_title":"Evo-ViT: Slow-Fast Token Evolution for Dynamic Vision Transformer","code":"https://github.com/YifanXu74/Evo-ViT","n_code_links":1,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":564,"model":"Visformer-S","metrics":{"GFLOPs":"4.9","Number of params":"40.2M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-04-26","paper":"/paper/visformer-the-vision-friendly-transformer","paper_url":"https://arxiv.org/abs/2104.12533v4","paper_title":"Visformer: The Vision-friendly Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":565,"model":"ConViT-S+","metrics":{"GFLOPs":"10","Number of params":"48M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":566,"model":"ConvMixer-1536/20","metrics":{"Number of params":"51.6M","Top 1 Accuracy":"82.20"},"uses_additional_data":false,"paper_date":"2022-01-24","paper":"/paper/patches-are-all-you-need-1","paper_url":"https://arxiv.org/abs/2201.09792v1","paper_title":"Patches Are All You Need?","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":12,"syntology":{"n_ran":8,"n_unverified":0,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":567,"model":"DeepVit-L","metrics":{"Number of params":"55M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/deepvit-towards-deeper-vision-transformer","paper_url":"https://arxiv.org/abs/2103.11886v4","paper_title":"DeepViT: Towards Deeper Vision Transformer","code":"https://github.com/zhoudaquan/dvit_repo","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":568,"model":"SENet-152","metrics":{"Number of params":"66.6M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":569,"model":"ResNeXt-101 32x8d","metrics":{"Number of params":"88M","Top 1 Accuracy":"82.2%"},"uses_additional_data":false,"paper_date":"2018-05-02","paper":"/paper/exploring-the-limits-of-weakly-supervised","paper_url":"http://arxiv.org/abs/1805.00932v1","paper_title":"Exploring the Limits of Weakly Supervised Pretraining","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":4,"syntology":null},{"rank_in_archive_order":570,"model":"TransBoost-Swin-T","metrics":{"Number of params":"71.71M","Top 1 Accuracy":"82.16%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":571,"model":"ResNeXt-101, 64x4d, S=2(224px)","metrics":{"GFLOPs":"18.8","Number of params":"88.6M","Top 1 Accuracy":"82.13%"},"uses_additional_data":false,"paper_date":"2020-11-30","paper":"/paper/splitnet-divide-and-co-training","paper_url":"https://arxiv.org/abs/2011.14660v4","paper_title":"Towards Better Accuracy-efficiency Trade-offs: Divide and Co-training","code":"https://github.com/freeformrobotics/divide-and-co-training","n_code_links":2,"syntology":null},{"rank_in_archive_order":572,"model":"ToMe-ViT-S","metrics":{"Top 1 Accuracy":"82.11%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":573,"model":"AMD(ViT-S/16)","metrics":{"Number of params":"22M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/asymmetric-masked-distillation-for-pre","paper_url":"https://arxiv.org/abs/2311.03149v2","paper_title":"Asymmetric Masked Distillation for Pre-Training Small Foundation Models","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":574,"model":"PatchConvNet-S60","metrics":{"Number of params":"25.2M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2021-12-27","paper":"/paper/augmenting-convolutional-networks-with","paper_url":"https://arxiv.org/abs/2112.13692v1","paper_title":"Augmenting Convolutional networks with attention-based aggregation","code":"https://github.com/facebookresearch/deit","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":575,"model":"Pyramid ViG-S","metrics":{"GFLOPs":"4.6","Number of params":"27.3M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2022-06-01","paper":"/paper/vision-gnn-an-image-is-worth-graph-of-nodes","paper_url":"https://arxiv.org/abs/2206.00272v3","paper_title":"Vision GNN: An Image is Worth Graph of Nodes","code":"https://github.com/huawei-noah/efficient-ai-backbones","n_code_links":9,"syntology":{"n_ran":19,"n_unverified":15,"n_samples":34,"n_pointer_only_licence":22}},{"rank_in_archive_order":576,"model":"ConvNeXt-T","metrics":{"GFLOPs":"4.5","Number of params":"29M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2022-01-10","paper":"/paper/a-convnet-for-the-2020s","paper_url":"https://arxiv.org/abs/2201.03545v2","paper_title":"A ConvNet for the 2020s","code":"https://github.com/keras-team/keras/blob/master/keras/applications/convnext.py","n_code_links":54,"syntology":{"n_ran":54,"n_unverified":26,"n_samples":80,"n_pointer_only_licence":11}},{"rank_in_archive_order":577,"model":"CycleMLP-B2 + STD","metrics":{"GFLOPs":"4.0","Number of params":"30.1M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2022-07-23","paper":"/paper/spatial-channel-token-distillation-for-vision","paper_url":"https://proceedings.mlr.press/v162/li22c.html","paper_title":"Spatial-Channel Token Distillation for Vision MLPs","code":"https://github.com/devrimcavusoglu/std","n_code_links":1,"syntology":null},{"rank_in_archive_order":578,"model":"FasterViT-0","metrics":{"GFLOPs":"3.3","Number of params":"31.4M","Top 1 Accuracy":"82.1%"},"uses_additional_data":false,"paper_date":"2023-06-09","paper":"/paper/fastervit-fast-vision-transformers-with","paper_url":"https://arxiv.org/abs/2306.06189v2","paper_title":"FasterViT: Fast Vision Transformers with Hierarchical Attention","code":"https://github.com/NVlabs/FasterViT","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":5,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":579,"model":"CeiT-S","metrics":{"GFLOPs":"4.5","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":580,"model":"DIFFQ (λ=1e−2)","metrics":{"Top 1 Accuracy":"82.0"},"uses_additional_data":false,"paper_date":"2021-04-20","paper":"/paper/differentiable-model-compression-via-pseudo","paper_url":"https://arxiv.org/abs/2104.09987v3","paper_title":"Differentiable Model Compression via Pseudo Quantization Noise","code":"https://github.com/facebookresearch/diffq","n_code_links":1,"syntology":null},{"rank_in_archive_order":581,"model":"NEXcepTion-S","metrics":{"Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2022-12-16","paper":"/paper/from-xception-to-nexception-new-design","paper_url":"https://arxiv.org/abs/2212.08448v2","paper_title":"From Xception to NEXcepTion: New Design Decisions and Neural Architecture Search","code":"https://github.com/hadarshavit/nexception","n_code_links":1,"syntology":null},{"rank_in_archive_order":582,"model":"GC ViT-XT","metrics":{"GFLOPs":"2.6","Number of params":"20M","Top 1 Accuracy":"82.0%"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":583,"model":"Container-Light","metrics":{"GFLOPs":"3.2","Number of params":"20M","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2021-06-02","paper":"/paper/container-context-aggregation-network","paper_url":"https://arxiv.org/abs/2106.01401v2","paper_title":"Container: Context Aggregation Network","code":"https://github.com/allenai/container","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":7,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":584,"model":"ViL-Small","metrics":{"GFLOPs":"4.86","Number of params":"24.6M","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":585,"model":"PVTv2-B2","metrics":{"GFLOPs":"4","Number of params":"25.4M","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":586,"model":"ActiveMLP-T","metrics":{"GFLOPs":"4","Number of params":"27.2M","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2022-03-11","paper":"/paper/activemlp-an-mlp-like-architecture-with","paper_url":"https://arxiv.org/abs/2203.06108v2","paper_title":"Active Token Mixer","code":"https://github.com/microsoft/TokenMixers","n_code_links":2,"syntology":null},{"rank_in_archive_order":587,"model":"LITv2-S","metrics":{"GFLOPs":"3.7","Number of params":"28M","Top 1 Accuracy":"82%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/fast-vision-transformers-with-hilo-attention","paper_url":"https://arxiv.org/abs/2205.13213v5","paper_title":"Fast Vision Transformers with HiLo Attention","code":"https://github.com/Westlake-AI/openmixup","n_code_links":5,"syntology":{"n_ran":2,"n_unverified":11,"n_samples":13,"n_pointer_only_licence":0}},{"rank_in_archive_order":588,"model":"DAT-T","metrics":{"GFLOPs":"4.6","Number of params":"29M","Top 1 Accuracy":"82.0%"},"uses_additional_data":false,"paper_date":"2022-01-03","paper":"/paper/vision-transformer-with-deformable-attention","paper_url":"https://arxiv.org/abs/2201.00520v3","paper_title":"Vision Transformer with Deformable Attention","code":"https://github.com/leaplabthu/dat","n_code_links":2,"syntology":{"n_ran":8,"n_unverified":2,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":589,"model":"Swin-T (SAMix+DM)","metrics":{"Top 1 Accuracy":"81.97%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":590,"model":"EViT (fuse)","metrics":{"Top 1 Accuracy":"81.96%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":591,"model":"Swin-T (AutoMix+DM)","metrics":{"Top 1 Accuracy":"81.92%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":592,"model":"GTP-LV-ViT-S/P8","metrics":{"GFLOPs":"4.8","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":593,"model":"T2T-ViT-19","metrics":{"GFLOPs":"17.0","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":594,"model":"ResNet-101 (224 res, Fast Knowledge Distillation)","metrics":{"Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/a-fast-knowledge-distillation-framework-for","paper_url":"https://arxiv.org/abs/2112.01528v1","paper_title":"A Fast Knowledge Distillation Framework for Visual Recognition","code":"https://github.com/szq0214/MEAL-V2","n_code_links":2,"syntology":null},{"rank_in_archive_order":595,"model":"Discrete Adversarial Distillation (ViT-B, 224)","metrics":{"Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2023-11-02","paper":"/paper/distilling-out-of-distribution-robustness-1","paper_url":"https://arxiv.org/abs/2311.01441v2","paper_title":"Distilling Out-of-Distribution Robustness from Vision-Language Foundation Models","code":"https://github.com/lapisrocks/DiscreteAdversarialDistillation","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":596,"model":"DeBiFormer-T","metrics":{"Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2024-10-11","paper":"/paper/debiformer-vision-transformer-with-deformable","paper_url":"https://arxiv.org/abs/2410.08582v1","paper_title":"DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention","code":"https://github.com/maclong01/DeBiFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":597,"model":"RVT-S*","metrics":{"GFLOPs":"4.7","Number of params":"23.3M","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-05-17","paper":"/paper/rethinking-the-design-principles-of-robust","paper_url":"https://arxiv.org/abs/2105.07926v4","paper_title":"Towards Robust Vision Transformer","code":"https://github.com/alibaba/easyrobust","n_code_links":2,"syntology":null},{"rank_in_archive_order":598,"model":"PiT-S","metrics":{"GFLOPs":"2.9","Number of params":"23.5M","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/rethinking-spatial-dimensions-of-vision","paper_url":"https://arxiv.org/abs/2103.16302v2","paper_title":"Rethinking Spatial Dimensions of Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":10,"n_unverified":10,"n_samples":20,"n_pointer_only_licence":0}},{"rank_in_archive_order":599,"model":"sMLPNet-T (ImageNet-1k)","metrics":{"Number of params":"24.1M","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-09-12","paper":"/paper/sparse-mlp-for-image-recognition-is-self","paper_url":"https://arxiv.org/abs/2109.05422v2","paper_title":"Sparse MLP for Image Recognition: Is Self-Attention Really Necessary?","code":"https://github.com/microsoft/SPACH","n_code_links":2,"syntology":null},{"rank_in_archive_order":600,"model":"ViL-Base-W","metrics":{"GFLOPs":"6.74","Number of params":"79M","Top 1 Accuracy":"81.9%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":601,"model":"Swin-T+SSA","metrics":{"Top 1 Accuracy":"81.89%"},"uses_additional_data":false,"paper_date":"2023-06-02","paper":"/paper/the-information-pathways-hypothesis","paper_url":"https://arxiv.org/abs/2306.01705v1","paper_title":"The Information Pathways Hypothesis: Transformers are Dynamic Self-Ensembles","code":"https://github.com/shamim-hussain/ssa","n_code_links":1,"syntology":null},{"rank_in_archive_order":602,"model":"AOGNet-40M-AN","metrics":{"GFLOPs":"7.51","Top 1 Accuracy":"81.87%"},"uses_additional_data":false,"paper_date":"2019-08-04","paper":"/paper/attentive-normalization","paper_url":"https://arxiv.org/abs/1908.01259v3","paper_title":"Attentive Normalization","code":"https://github.com/iVMCL/AOGNet-v2","n_code_links":2,"syntology":null},{"rank_in_archive_order":603,"model":"FBNetV5","metrics":{"GFLOPs":"0.726","Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":604,"model":"NASViT-A5","metrics":{"GFLOPs":"0.757","Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":605,"model":"ResNet-200","metrics":{"Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2107.12028v2","paper_title":"Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":606,"model":"RepMLPNet-L256","metrics":{"Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/repmlpnet-hierarchical-vision-mlp-with-re","paper_url":"https://arxiv.org/abs/2112.11081v2","paper_title":"RepMLPNet: Hierarchical Vision MLP with Re-parameterized Locality","code":"https://github.com/towhee-io/towhee","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":607,"model":"NEXcepTion-TP","metrics":{"Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2022-12-16","paper":"/paper/from-xception-to-nexception-new-design","paper_url":"https://arxiv.org/abs/2212.08448v2","paper_title":"From Xception to NEXcepTion: New Design Decisions and Neural Architecture Search","code":"https://github.com/hadarshavit/nexception","n_code_links":1,"syntology":null},{"rank_in_archive_order":608,"model":"NAT-Mini","metrics":{"GFLOPs":"2.7","Number of params":"20M","Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2204.07143v5","paper_title":"Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":609,"model":"DiNAT-Mini","metrics":{"GFLOPs":"2.7","Number of params":"20M","Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2022-09-29","paper":"/paper/dilated-neighborhood-attention-transformer","paper_url":"https://arxiv.org/abs/2209.15001v3","paper_title":"Dilated Neighborhood Attention Transformer","code":"https://github.com/huggingface/transformers","n_code_links":7,"syntology":null},{"rank_in_archive_order":610,"model":"ResNet-152 (A2)","metrics":{"Number of params":"60.2M","Top 1 Accuracy":"81.8%"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":611,"model":"DeiT-B","metrics":{"GFLOPs":"16.87","Number of params":"86.6M","Top 1 Accuracy":"81.8"},"uses_additional_data":false,"paper_date":"2024-09-16","paper":"/paper/kolmogorov-arnold-transformer","paper_url":"https://arxiv.org/abs/2409.10594v1","paper_title":"Kolmogorov-Arnold Transformer","code":"https://github.com/Adamdad/kat","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":612,"model":"MEAL V2 (ResNet-50) (380 res)","metrics":{"Number of params":"25.6M","Top 1 Accuracy":"81.72%"},"uses_additional_data":false,"paper_date":"2020-09-17","paper":"/paper/meal-v2-boosting-vanilla-resnet-50-to-80-top","paper_url":"https://arxiv.org/abs/2009.08453v2","paper_title":"MEAL V2: Boosting Vanilla ResNet-50 to 80%+ Top-1 Accuracy on ImageNet without Tricks","code":"https://github.com/szq0214/MEAL-V2","n_code_links":1,"syntology":null},{"rank_in_archive_order":613,"model":"gSwin-T","metrics":{"GFLOPs":"3.6","Number of params":"21.8M","Top 1 Accuracy":"81.71%"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":614,"model":"FBNetV5-A-CLS","metrics":{"GFLOPs":"0.685","Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":615,"model":"T2T-ViT-14","metrics":{"Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/beyond-self-attention-external-attention","paper_url":"https://arxiv.org/abs/2105.02358v2","paper_title":"Beyond Self-attention: External Attention using Two Linear Layers for Visual Tasks","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":616,"model":"QnA-ViT-Tiny","metrics":{"GFLOPs":"2.5","Number of params":"16M","Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2021-12-21","paper":"/paper/learned-queries-for-efficient-local-attention","paper_url":"https://arxiv.org/abs/2112.11435v2","paper_title":"Learned Queries for Efficient Local Attention","code":"https://github.com/moabarar/qna","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":5,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":617,"model":"AutoFormer-small","metrics":{"GFLOPs":"5.1","Number of params":"22.9M","Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/autoformer-searching-transformers-for-visual","paper_url":"https://arxiv.org/abs/2107.00651v1","paper_title":"AutoFormer: Searching Transformers for Visual Recognition","code":"https://github.com/microsoft/AutoML","n_code_links":2,"syntology":null},{"rank_in_archive_order":618,"model":"Shift-T","metrics":{"GFLOPs":"4.4","Number of params":"28M","Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2022-01-26","paper":"/paper/when-shift-operation-meets-vision-transformer","paper_url":"https://arxiv.org/abs/2201.10801v1","paper_title":"When Shift Operation Meets Vision Transformer: An Extremely Simple Alternative to Attention Mechanism","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/shiftvit.py","n_code_links":2,"syntology":{"n_ran":6,"n_unverified":1,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":619,"model":"BoTNet T3","metrics":{"GFLOPs":"7.3","Number of params":"33.5M","Top 1 Accuracy":"81.7%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":620,"model":"CvT-13","metrics":{"GFLOPs":"4.5","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/cvt-introducing-convolutions-to-vision","paper_url":"https://arxiv.org/abs/2103.15808v1","paper_title":"CvT: Introducing Convolutions to Vision Transformers","code":"https://github.com/huggingface/transformers","n_code_links":16,"syntology":{"n_ran":29,"n_unverified":18,"n_samples":47,"n_pointer_only_licence":4}},{"rank_in_archive_order":621,"model":"ResNet-152 (SAM)","metrics":{"Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2020-10-03","paper":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_url":"https://arxiv.org/abs/2010.01412v3","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","code":"https://github.com/davda54/sam","n_code_links":18,"syntology":{"n_ran":8,"n_unverified":12,"n_samples":20,"n_pointer_only_licence":6}},{"rank_in_archive_order":622,"model":"UniRepLKNet-N","metrics":{"Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":623,"model":"CloFormer-S","metrics":{"GFLOPs":"2","Number of params":"12.3M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2023-03-31","paper":"/paper/rethinking-local-perception-in-lightweight","paper_url":"https://arxiv.org/abs/2303.17803v5","paper_title":"Rethinking Local Perception in Lightweight Vision Transformer","code":"https://github.com/qhfan/CloFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":624,"model":"LeViT-256","metrics":{"GFLOPs":"1.066","Number of params":"17.8M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":625,"model":"ReXNet_2.0","metrics":{"GFLOPs":"1.5","Number of params":"19M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":626,"model":"SE-CoTNetD-50","metrics":{"GFLOPs":"4.1","Number of params":"23.1M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/contextual-transformer-networks-for-visual","paper_url":"https://arxiv.org/abs/2107.12292v1","paper_title":"Contextual Transformer Networks for Visual Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":7,"syntology":null},{"rank_in_archive_order":627,"model":"CoAtNet-0","metrics":{"GFLOPs":"4.2","Number of params":"25M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2021-06-09","paper":"/paper/coatnet-marrying-convolution-and-attention","paper_url":"https://arxiv.org/abs/2106.04803v2","paper_title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":2,"n_unverified":3,"n_samples":5,"n_pointer_only_licence":1}},{"rank_in_archive_order":628,"model":"gMLP-B","metrics":{"GFLOPs":"31.6","Number of params":"73M","Top 1 Accuracy":"81.6%"},"uses_additional_data":false,"paper_date":"2021-05-17","paper":"/paper/pay-attention-to-mlps","paper_url":"https://arxiv.org/abs/2105.08050v2","paper_title":"Pay Attention to MLPs","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":20,"syntology":{"n_ran":34,"n_unverified":10,"n_samples":44,"n_pointer_only_licence":11}},{"rank_in_archive_order":629,"model":"CoE-Large + CondConv","metrics":{"GFLOPs":"0.214","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2021-07-08","paper":"/paper/collaboration-of-experts-achieving-80-top-1","paper_url":"https://arxiv.org/abs/2107.03815v2","paper_title":"Collaboration of Experts: Achieving 80% Top-1 Accuracy on ImageNet with 100M FLOPs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":630,"model":"GTP-DeiT-B/P8","metrics":{"GFLOPs":"13.1","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":631,"model":"NEXcepTion-T","metrics":{"Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2022-12-16","paper":"/paper/from-xception-to-nexception-new-design","paper_url":"https://arxiv.org/abs/2212.08448v2","paper_title":"From Xception to NEXcepTion: New Design Decisions and Neural Architecture Search","code":"https://github.com/hadarshavit/nexception","n_code_links":1,"syntology":null},{"rank_in_archive_order":632,"model":"DeiT-S-24 + GFSA","metrics":{"Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2023-12-07","paper":"/paper/graph-convolutions-enrich-the-self-attention","paper_url":"https://arxiv.org/abs/2312.04234v5","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","code":"https://github.com/jeongwhanchoi/gfsa","n_code_links":1,"syntology":{"n_ran":19,"n_unverified":10,"n_samples":29,"n_pointer_only_licence":0}},{"rank_in_archive_order":633,"model":"NoisyStudent (EfficientNet-B1)","metrics":{"Number of params":"7.8M","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":634,"model":"TinyViT-11M","metrics":{"GFLOPs":"2.0","Number of params":"11M","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":635,"model":"Transformer local-attention (NesT-T)","metrics":{"GFLOPs":"5.8","Number of params":"17M","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2021-05-26","paper":"/paper/aggregating-nested-transformers","paper_url":"https://arxiv.org/abs/2105.12723v4","paper_title":"Nested Hierarchical Transformer: Towards Accurate, Data-Efficient and Interpretable Visual Understanding","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":7,"n_unverified":19,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":636,"model":"T2T-ViT-14","metrics":{"GFLOPs":"9.6","Number of params":"21.5M","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2021-01-28","paper":"/paper/tokens-to-token-vit-training-vision","paper_url":"https://arxiv.org/abs/2101.11986v3","paper_title":"Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet","code":"https://github.com/open-mmlab/mmclassification","n_code_links":13,"syntology":{"n_ran":21,"n_unverified":5,"n_samples":26,"n_pointer_only_licence":8}},{"rank_in_archive_order":637,"model":"CrossViT-15","metrics":{"GFLOPs":"5.8","Number of params":"27.4M","Top 1 Accuracy":"81.5%"},"uses_additional_data":false,"paper_date":"2021-03-27","paper":"/paper/2103-14899","paper_url":"https://arxiv.org/abs/2103.14899v2","paper_title":"CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image Classification","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":15,"syntology":{"n_ran":17,"n_unverified":9,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":638,"model":"PyConvResNet-101","metrics":{"Number of params":"42.3M","Top 1 Accuracy":"81.49%"},"uses_additional_data":false,"paper_date":"2020-06-20","paper":"/paper/pyramidal-convolution-rethinking","paper_url":"https://arxiv.org/abs/2006.11538v1","paper_title":"Pyramidal Convolution: Rethinking Convolutional Neural Networks for Visual Recognition","code":"https://github.com/iduta/pyconv","n_code_links":3,"syntology":null},{"rank_in_archive_order":639,"model":"ViT-B/16 (RPE w/ GAB)","metrics":{"Top 1 Accuracy":"81.484%"},"uses_additional_data":false,"paper_date":"2023-05-08","paper":"/paper/understanding-gaussian-attention-bias-of","paper_url":"https://arxiv.org/abs/2305.04722v1","paper_title":"Understanding Gaussian Attention Bias of Vision Transformers Using Effective Receptive Fields","code":"https://github.com/kmbmjn/GaussianAttentionBias","n_code_links":1,"syntology":null},{"rank_in_archive_order":640,"model":"NASViT-A4","metrics":{"GFLOPs":"0.591","Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":641,"model":"MobileOne-S4 (distill)","metrics":{"GFLOPs":"2.9","Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":642,"model":"DeiT-S with iRPE-QKV","metrics":{"GFLOPs":"9.770","Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":643,"model":"ViT-S @224 (DeiT III)","metrics":{"Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2022-04-14","paper":"/paper/deit-iii-revenge-of-the-vit","paper_url":"https://arxiv.org/abs/2204.07118v1","paper_title":"DeiT III: Revenge of the ViT","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":null},{"rank_in_archive_order":644,"model":"BiFormer-T (IN1k ptretrain)","metrics":{"Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2023-03-15","paper":"/paper/biformer-vision-transformer-with-bi-level","paper_url":"https://arxiv.org/abs/2303.08810v1","paper_title":"BiFormer: Vision Transformer with Bi-Level Routing Attention","code":"https://github.com/rayleizhu/biformer","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":0,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":645,"model":"SENet-101","metrics":{"Number of params":"49.2M","Top 1 Accuracy":"81.4%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":646,"model":"GFNet-S","metrics":{"Top 1 Accuracy":"81.33%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":647,"model":"ResNet-200 (Adversarial Autoaugment)","metrics":{"Top 1 Accuracy":"81.32%"},"uses_additional_data":false,"paper_date":"2019-12-24","paper":"/paper/adversarial-autoaugment-1","paper_url":"https://arxiv.org/abs/1912.11188v1","paper_title":"Adversarial AutoAugment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":648,"model":"MultiGrain PNASNet (300px)","metrics":{"Top 1 Accuracy":"81.3%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":649,"model":"ResNet-152","metrics":{"Top 1 Accuracy":"81.3%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2107.12028v2","paper_title":"Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":650,"model":"ConViT-S","metrics":{"GFLOPs":"5.4","Number of params":"27M","Top 1 Accuracy":"81.3%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":651,"model":"Swin-T","metrics":{"GFLOPs":"4.5","Number of params":"29M","Top 1 Accuracy":"81.3%"},"uses_additional_data":false,"paper_date":"2021-03-25","paper":"/paper/swin-transformer-hierarchical-vision","paper_url":"https://arxiv.org/abs/2103.14030v2","paper_title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","code":"https://github.com/huggingface/transformers","n_code_links":80,"syntology":{"n_ran":108,"n_unverified":99,"n_samples":207,"n_pointer_only_licence":43}},{"rank_in_archive_order":652,"model":"SimpleNetV1-9m-correct-labels","metrics":{"Number of params":"9.5M","Top 1 Accuracy":"81.24"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":653,"model":"Res2Net-101","metrics":{"Top 1 Accuracy":"81.23%"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":654,"model":"ResNeXt-101 (Debiased+CutMix)","metrics":{"Top 1 Accuracy":"81.2"},"uses_additional_data":false,"paper_date":"2020-10-12","paper":"/paper/shape-texture-debiased-neural-network-1","paper_url":"https://arxiv.org/abs/2010.05981v2","paper_title":"Shape-Texture Debiased Neural Network Training","code":"https://github.com/LiYingwei/ShapeTextureDebiasedTraining","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":655,"model":"PVT-S (+MixPro)","metrics":{"Top 1 Accuracy":"81.2%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":656,"model":"Swin-T (PuzzleMix+DM)","metrics":{"Top 1 Accuracy":"81.16%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":657,"model":"TransBoost-ResNet50-StrikesBack","metrics":{"Number of params":"25.56M","Top 1 Accuracy":"81.15%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":658,"model":"ResNeSt-50","metrics":{"GFLOPs":"5.39","Number of params":"27.5M","Top 1 Accuracy":"81.13%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":659,"model":"DeiT-S (SAMix+DM)","metrics":{"Top 1 Accuracy":"81.12%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":660,"model":"DeiT-S with iRPE-QK","metrics":{"GFLOPs":"9.412","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":661,"model":"DeiT-S-12 + GFSA","metrics":{"Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2023-12-07","paper":"/paper/graph-convolutions-enrich-the-self-attention","paper_url":"https://arxiv.org/abs/2312.04234v5","paper_title":"Graph Convolutions Enrich the Self-Attention in Transformers!","code":"https://github.com/jeongwhanchoi/gfsa","n_code_links":1,"syntology":{"n_ran":19,"n_unverified":10,"n_samples":29,"n_pointer_only_licence":0}},{"rank_in_archive_order":662,"model":"CAS-ViT-S","metrics":{"GFLOPs":"0.932","Number of params":"5.76M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2024-08-07","paper":"/paper/cas-vit-convolutional-additive-self-attention","paper_url":"https://arxiv.org/abs/2408.03703v2","paper_title":"CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications","code":"https://github.com/tianfang-zhang/cas-vit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":663,"model":"EfficientNet-B3","metrics":{"Number of params":"12M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":664,"model":"VAN-B1","metrics":{"GFLOPs":"2.5","Number of params":"13.9M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":665,"model":"RevBiFPN-S3","metrics":{"GFLOPs":"3.33","Number of params":"19.6M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":666,"model":"ResNet-152x2-SAM","metrics":{"Number of params":"236M","Top 1 Accuracy":"81.1%"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":667,"model":"DynamicViT-S","metrics":{"Top 1 Accuracy":"81.09%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":668,"model":"ResNet-101 (SAMix)","metrics":{"Number of params":"44.6M","Top 1 Accuracy":"81.08%"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":669,"model":"NASViT-A3","metrics":{"GFLOPs":"0.528","Top 1 Accuracy":"81.0%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":670,"model":"ViTAE-13M","metrics":{"GFLOPs":"6.8","Number of params":"13.2M","Top 1 Accuracy":"81%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":671,"model":"ResNet-101 (AutoMix)","metrics":{"Number of params":"44.6M","Top 1 Accuracy":"80.98%"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":672,"model":"DeiT-S (AutoMix+DM)","metrics":{"Top 1 Accuracy":"80.91%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":673,"model":"ResNet-101","metrics":{"Top 1 Accuracy":"80.9%"},"uses_additional_data":false,"paper_date":"2021-07-26","paper":"/paper/parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2107.12028v2","paper_title":"Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":1}},{"rank_in_archive_order":674,"model":"CAIT-XXS-24","metrics":{"GFLOPs":"9.6","Number of params":"12M","Top 1 Accuracy":"80.9%"},"uses_additional_data":false,"paper_date":"2021-03-31","paper":"/paper/going-deeper-with-image-transformers","paper_url":"https://arxiv.org/abs/2103.17239v2","paper_title":"Going deeper with Image Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":21,"syntology":{"n_ran":5,"n_unverified":6,"n_samples":11,"n_pointer_only_licence":2}},{"rank_in_archive_order":675,"model":"DeiT-S with iRPE-K","metrics":{"GFLOPs":"9.318","Number of params":"22M","Top 1 Accuracy":"80.9%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":676,"model":"CentroidViT-S (arXiv, 2021-02)","metrics":{"GFLOPs":"9.4","Number of params":"22.3M","Top 1 Accuracy":"80.9%"},"uses_additional_data":false,"paper_date":"2021-02-17","paper":"/paper/centroid-transformers-learning-to-abstract","paper_url":"https://arxiv.org/abs/2102.08606v2","paper_title":"Centroid Transformers: Learning to Abstract with Attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":677,"model":"ResNeXt-101  64x4","metrics":{"GFLOPs":"31.5","Number of params":"83.6M","Top 1 Accuracy":"80.9%","Top 5 Accuracy":"94.7"},"uses_additional_data":false,"paper_date":"2016-11-16","paper":"/paper/aggregated-residual-transformations-for-deep","paper_url":"http://arxiv.org/abs/1611.05431v2","paper_title":"Aggregated Residual Transformations for Deep Neural Networks","code":"https://github.com/pytorch/vision","n_code_links":61,"syntology":{"n_ran":34,"n_unverified":46,"n_samples":80,"n_pointer_only_licence":13}},{"rank_in_archive_order":678,"model":"AlphaNet-A6","metrics":{"GFLOPs":"0.709","Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":679,"model":"ResNet-200 (Supervised Contrastive)","metrics":{"Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2020-04-23","paper":"/paper/supervised-contrastive-learning","paper_url":"https://arxiv.org/abs/2004.11362v5","paper_title":"Supervised Contrastive Learning","code":"https://github.com/google-research/google-research/tree/master/supcon","n_code_links":26,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":0}},{"rank_in_archive_order":680,"model":"UniNet-B0","metrics":{"GFLOPs":"0.555","Number of params":"11.5M","Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2022-07-12","paper":"/paper/uninet-unified-architecture-search-with-1","paper_url":"https://arxiv.org/abs/2207.05420v2","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":"https://github.com/sense-x/tokenmix","n_code_links":2,"syntology":null},{"rank_in_archive_order":681,"model":"LocalViT-S","metrics":{"GFLOPs":"4.6","Number of params":"22.4M","Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/localvit-bringing-locality-to-vision","paper_url":"https://arxiv.org/abs/2104.05707v1","paper_title":"LocalViT: Bringing Locality to Vision Transformers","code":"https://github.com/ofsoundof/LocalViT","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":682,"model":"DAFT-conv (384 heads, 300 epochs)","metrics":{"Number of params":"23M","Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/a-dot-product-attention-free-transformer","paper_url":"https://openreview.net/forum?id=JVR4JswsEM","paper_title":"A Dot Product Attention Free Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":683,"model":"ResMLP-S24","metrics":{"GFLOPs":"6","Number of params":"30M","Top 1 Accuracy":"80.8%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":684,"model":"MNv4-Hybrid-M","metrics":{"Top 1 Accuracy":"80.7%"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/mobilenetv4-universal-models-for-the-mobile","paper_url":"https://arxiv.org/abs/2404.10518v2","paper_title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","code":"https://github.com/tensorflow/models/blob/master/official/vision/modeling/backbones/mobilenet.py","n_code_links":7,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":1}},{"rank_in_archive_order":685,"model":"TinyViT-5M-distill (21k)","metrics":{"GFLOPs":"1.3","Number of params":"5.4M","Top 1 Accuracy":"80.7%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":686,"model":"CoE-Large","metrics":{"GFLOPs":"0.194","Number of params":"95.3M","Top 1 Accuracy":"80.7%"},"uses_additional_data":false,"paper_date":"2021-07-08","paper":"/paper/collaboration-of-experts-achieving-80-top-1","paper_url":"https://arxiv.org/abs/2107.03815v2","paper_title":"Collaboration of Experts: Achieving 80% Top-1 Accuracy on ImageNet with 100M FLOPs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":687,"model":"MEAL V2 (ResNet-50) (224 res)","metrics":{"Top 1 Accuracy":"80.67%"},"uses_additional_data":false,"paper_date":"2020-09-17","paper":"/paper/meal-v2-boosting-vanilla-resnet-50-to-80-top","paper_url":"https://arxiv.org/abs/2009.08453v2","paper_title":"MEAL V2: Boosting Vanilla ResNet-50 to 80%+ Top-1 Accuracy on ImageNet without Tricks","code":"https://github.com/szq0214/MEAL-V2","n_code_links":1,"syntology":null},{"rank_in_archive_order":688,"model":"TokenLearner-ViT-8","metrics":{"Top 1 Accuracy":"80.66%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":689,"model":"ResNeSt-50-fast","metrics":{"GFLOPs":"4.34","Number of params":"27.5M","Top 1 Accuracy":"80.64%"},"uses_additional_data":false,"paper_date":"2020-04-19","paper":"/paper/resnest-split-attention-networks","paper_url":"https://arxiv.org/abs/2004.08955v2","paper_title":"ResNeSt: Split-Attention Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":36,"syntology":{"n_ran":8,"n_unverified":40,"n_samples":48,"n_pointer_only_licence":23}},{"rank_in_archive_order":690,"model":"TransBoost-ResNet152","metrics":{"Number of params":"60.19M","Top 1 Accuracy":"80.64%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":691,"model":"ResNet-200 (Fast AA)","metrics":{"Top 1 Accuracy":"80.6%"},"uses_additional_data":false,"paper_date":"2019-05-01","paper":"/paper/fast-autoaugment","paper_url":"https://arxiv.org/abs/1905.00397v2","paper_title":"Fast AutoAugment","code":"https://github.com/kakaobrain/fast-autoaugment","n_code_links":11,"syntology":{"n_ran":22,"n_unverified":18,"n_samples":40,"n_pointer_only_licence":3}},{"rank_in_archive_order":692,"model":"CaiT-XXS (+MixPro)","metrics":{"Top 1 Accuracy":"80.6%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":693,"model":"FastViT-SA12","metrics":{"Top 1 Accuracy":"80.6%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":694,"model":"ResNeXt-101 (CutMix)","metrics":{"Top 1 Accuracy":"80.53%"},"uses_additional_data":false,"paper_date":"2019-05-13","paper":"/paper/cutmix-regularization-strategy-to-train","paper_url":"https://arxiv.org/abs/1905.04899v2","paper_title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":30,"syntology":{"n_ran":17,"n_unverified":7,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":695,"model":"NASViT-A2","metrics":{"GFLOPs":"0.421","Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":696,"model":"Attention-92","metrics":{"Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2017-04-23","paper":"/paper/residual-attention-network-for-image","paper_url":"http://arxiv.org/abs/1704.06904v1","paper_title":"Residual Attention Network for Image Classification","code":"https://github.com/tengshaofeng/ResidualAttentionNetwork-pytorch","n_code_links":19,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":697,"model":"NAT-M4","metrics":{"Number of params":"9.1M","Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2020-05-12","paper":"/paper/neural-architecture-transfer","paper_url":"https://arxiv.org/abs/2005.05859v2","paper_title":"Neural Architecture Transfer","code":"https://github.com/human-analysis/neural-architecture-transfer","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":698,"model":"IPT-T","metrics":{"GFLOPs":"2.3","Number of params":"14.0M","Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2022-12-06","paper":"/paper/incepformer-efficient-inception-transformer","paper_url":"https://arxiv.org/abs/2212.03035v1","paper_title":"IncepFormer: Efficient Inception Transformer with Pyramid Pooling for Semantic Segmentation","code":"https://github.com/shendu0321/incepformer","n_code_links":1,"syntology":null},{"rank_in_archive_order":699,"model":"GLiT-Smalls","metrics":{"GFLOPs":"4.4","Number of params":"24.6M","Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2021-07-07","paper":"/paper/glit-neural-architecture-search-for-global","paper_url":"https://arxiv.org/abs/2107.02960v3","paper_title":"GLiT: Neural Architecture Search for Global and Local Image Transformer","code":"https://github.com/lpxtt/simtrack","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":700,"model":"HCGNet-C","metrics":{"GFLOPs":"7.1","Number of params":"42.2M","Top 1 Accuracy":"80.5%"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":701,"model":"DVT (T2T-ViT-12)","metrics":{"GFLOPs":"1.7","Top 1 Accuracy":"80.43%"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/not-all-images-are-worth-16x16-words-dynamic","paper_url":"https://arxiv.org/abs/2105.15075v2","paper_title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","code":"https://github.com/blackfeather-wang/Dynamic-Vision-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":702,"model":"GhostNetV3 1.6x","metrics":{"Top 1 Accuracy":"80.4%","Top 5 Accuracy":"95.2"},"uses_additional_data":false,"paper_date":"2024-04-17","paper":"/paper/ghostnetv3-exploring-the-training-strategies","paper_url":"https://arxiv.org/abs/2404.11202v2","paper_title":"GhostNetV3: Exploring the Training Strategies for Compact Models","code":"https://github.com/james77777778/keras-image-models","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":703,"model":"UniNet-B1","metrics":{"GFLOPs":"0.99","Number of params":"14M","Top 1 Accuracy":"80.4%"},"uses_additional_data":false,"paper_date":"2021-10-08","paper":"/paper/uninet-unified-architecture-search-with","paper_url":"https://arxiv.org/abs/2110.04035v1","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":704,"model":"DeiT-S (T2)","metrics":{"Number of params":"22M","Top 1 Accuracy":"80.4%"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":705,"model":"ResNet50 (A1)","metrics":{"Number of params":"25M","Top 1 Accuracy":"80.4%"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":706,"model":"gSwin-VT","metrics":{"GFLOPs":"2.3","Number of params":"15.5M","Top 1 Accuracy":"80.32%"},"uses_additional_data":false,"paper_date":"2022-08-24","paper":"/paper/gswin-gated-mlp-vision-model-with","paper_url":"https://arxiv.org/abs/2208.11718v1","paper_title":"gSwin: Gated MLP Vision Model with Hierarchical Structure of Shifted Window","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":707,"model":"AlphaNet-A5","metrics":{"GFLOPs":"0.491","Top 1 Accuracy":"80.3%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":708,"model":"ResNet-50+AutoDropout+RandAugment","metrics":{"Top 1 Accuracy":"80.3%"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":709,"model":"ReXNet_1.5","metrics":{"GFLOPs":"0.86","Number of params":"9.7M","Top 1 Accuracy":"80.3%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":710,"model":"DeiT-S (PuzzleMix+DM)","metrics":{"Top 1 Accuracy":"80.25%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":711,"model":"iAFF-ResNeXt-50-32x4d","metrics":{"Number of params":"34.7M","Top 1 Accuracy":"80.22%"},"uses_additional_data":false,"paper_date":"2020-09-29","paper":"/paper/attentional-feature-fusion","paper_url":"https://arxiv.org/abs/2009.14082v2","paper_title":"Attentional Feature Fusion","code":"https://github.com/YimianDai/open-aff","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":712,"model":"UniRepLKNet-P","metrics":{"Top 1 Accuracy":"80.2%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":713,"model":"FixEfficientNet-B0","metrics":{"GFLOPs":"1.60","Number of params":"5.3M","Top 1 Accuracy":"80.2%"},"uses_additional_data":false,"paper_date":"2020-03-18","paper":"/paper/fixing-the-train-test-resolution-discrepancy-2","paper_url":"https://arxiv.org/abs/2003.08237v5","paper_title":"Fixing the train-test resolution discrepancy: FixEfficientNet","code":"https://github.com/facebookresearch/FixRes","n_code_links":1,"syntology":null},{"rank_in_archive_order":714,"model":"DAFT-conv (16 heads)","metrics":{"Number of params":"20.3M","Top 1 Accuracy":"80.2%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/a-dot-product-attention-free-transformer","paper_url":"https://openreview.net/forum?id=JVR4JswsEM","paper_title":"A Dot Product Attention Free Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":715,"model":"ConvMLP-L","metrics":{"Number of params":"42.7M","Top 1 Accuracy":"80.2%"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":716,"model":"ResNet-50 (224 res, Fast Knowledge Distillation)","metrics":{"Top 1 Accuracy":"80.1%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/a-fast-knowledge-distillation-framework-for","paper_url":"https://arxiv.org/abs/2112.01528v1","paper_title":"A Fast Knowledge Distillation Framework for Visual Recognition","code":"https://github.com/szq0214/MEAL-V2","n_code_links":2,"syntology":null},{"rank_in_archive_order":717,"model":"HVT Base","metrics":{"Top 1 Accuracy":"80.1%"},"uses_additional_data":false,"paper_date":"2024-09-25","paper":"/paper/hvt-a-comprehensive-vision-framework-for","paper_url":"https://arxiv.org/abs/2409.16897v2","paper_title":"HVT: A Comprehensive Vision Framework for Learning in Non-Euclidean Space","code":"https://github.com/hyperbolicvit/hyperbolicvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":718,"model":"DAFT-conv (384 heads, 200 epochs)","metrics":{"Number of params":"23M","Top 1 Accuracy":"80.1%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/a-dot-product-attention-free-transformer","paper_url":"https://openreview.net/forum?id=JVR4JswsEM","paper_title":"A Dot Product Attention Free Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":719,"model":"Inception ResNet V2","metrics":{"Number of params":"55.8M","Top 1 Accuracy":"80.1%"},"uses_additional_data":false,"paper_date":"2016-02-23","paper":"/paper/inception-v4-inception-resnet-and-the-impact","paper_url":"http://arxiv.org/abs/1602.07261v2","paper_title":"Inception-v4, Inception-ResNet and the Impact of Residual Connections on Learning","code":"https://github.com/tensorflow/models","n_code_links":87,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":720,"model":"RandWire-WS","metrics":{"GFLOPs":"7.9","Number of params":"61.5M","Top 1 Accuracy":"80.1%"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/exploring-randomly-wired-neural-networks-for","paper_url":"http://arxiv.org/abs/1904.01569v2","paper_title":"Exploring Randomly Wired Neural Networks for Image Recognition","code":"https://github.com/facebookresearch/pycls","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":31,"n_samples":31,"n_pointer_only_licence":0}},{"rank_in_archive_order":721,"model":"WideNet-H","metrics":{"Number of params":"63M","Top 1 Accuracy":"80.09%"},"uses_additional_data":false,"paper_date":"2021-07-25","paper":"/paper/go-wider-instead-of-deeper","paper_url":"https://arxiv.org/abs/2107.11817v3","paper_title":"Go Wider Instead of Deeper","code":"https://github.com/XueFuzhao/WideNet_Code","n_code_links":1,"syntology":null},{"rank_in_archive_order":722,"model":"CoE-Small + CondConv + PWLU","metrics":{"GFLOPs":"0.100","Top 1 Accuracy":"80%"},"uses_additional_data":false,"paper_date":"2021-07-08","paper":"/paper/collaboration-of-experts-achieving-80-top-1","paper_url":"https://arxiv.org/abs/2107.03815v2","paper_title":"Collaboration of Experts: Achieving 80% Top-1 Accuracy on ImageNet with 100M FLOPs","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":723,"model":"BasisNet-MV3","metrics":{"GFLOPs":"0.198","Top 1 Accuracy":"80%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/basisnet-two-stage-model-synthesis-for-1","paper_url":"https://arxiv.org/abs/2105.03014v1","paper_title":"BasisNet: Two-stage Model Synthesis for Efficient Inference","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":724,"model":"AlphaNet-A4","metrics":{"GFLOPs":"0.444","Top 1 Accuracy":"80.0%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":725,"model":"MogaNet-T (256res)","metrics":{"GFLOPs":"1.44","Number of params":"5.2M","Top 1 Accuracy":"80%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":726,"model":"LeViT-192","metrics":{"GFLOPs":"0.624","Number of params":"10.4M","Top 1 Accuracy":"80%"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":727,"model":"ResNet-101","metrics":{"Number of params":"44.4M","Top 1 Accuracy":"80%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":728,"model":"ResNet-200","metrics":{"Top 1 Accuracy":"79.9%"},"uses_additional_data":false,"paper_date":"2016-03-16","paper":"/paper/identity-mappings-in-deep-residual-networks","paper_url":"http://arxiv.org/abs/1603.05027v3","paper_title":"Identity Mappings in Deep Residual Networks","code":"https://github.com/tensorflow/models/tree/master/research/slim","n_code_links":54,"syntology":{"n_ran":3,"n_unverified":22,"n_samples":25,"n_pointer_only_licence":1}},{"rank_in_archive_order":729,"model":"MNv4-Conv-M","metrics":{"Top 1 Accuracy":"79.9%"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/mobilenetv4-universal-models-for-the-mobile","paper_url":"https://arxiv.org/abs/2404.10518v2","paper_title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","code":"https://github.com/tensorflow/models/blob/master/official/vision/modeling/backbones/mobilenet.py","n_code_links":7,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":1}},{"rank_in_archive_order":730,"model":"RegNetY-8.0GF","metrics":{"GFLOPs":"8","Number of params":"39.2M","Top 1 Accuracy":"79.9%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":731,"model":"ViT-B/16-SAM","metrics":{"Number of params":"87M","Top 1 Accuracy":"79.9%"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":732,"model":"TransBoost-ResNet101","metrics":{"Number of params":"44.55M","Top 1 Accuracy":"79.86%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":733,"model":"SKNet-101","metrics":{"GFLOPs":"8.46","Number of params":"48.9M","Top 1 Accuracy":"79.81%"},"uses_additional_data":false,"paper_date":"2019-03-15","paper":"/paper/selective-kernel-networks","paper_url":"http://arxiv.org/abs/1903.06586v2","paper_title":"Selective Kernel Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":20,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":734,"model":"FixResNet-50 CutMix","metrics":{"Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2019-06-14","paper":"/paper/fixing-the-train-test-resolution-discrepancy","paper_url":"https://arxiv.org/abs/1906.06423v4","paper_title":"Fixing the train-test resolution discrepancy","code":"https://github.com/facebookresearch/FixRes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":735,"model":"CSPResNeXt-50 + Mish","metrics":{"Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2019-08-23","paper":"/paper/mish-a-self-regularized-non-monotonic-neural","paper_url":"https://arxiv.org/abs/1908.08681v3","paper_title":"Mish: A Self Regularized Non-Monotonic Activation Function","code":"https://github.com/tensorflow/addons","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":9,"n_samples":12,"n_pointer_only_licence":0}},{"rank_in_archive_order":736,"model":"kNN-CLIP","metrics":{"Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2022-04-03","paper":"/paper/revisiting-a-knn-based-image-classification","paper_url":"https://arxiv.org/abs/2204.01186v2","paper_title":"Revisiting a kNN-based Image Classification System with High-capacity Storage","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":737,"model":"FastViT-S12","metrics":{"Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":738,"model":"CloFormer-XS","metrics":{"GFLOPs":"1.1","Number of params":"7.2M","Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2023-03-31","paper":"/paper/rethinking-local-perception-in-lightweight","paper_url":"https://arxiv.org/abs/2303.17803v5","paper_title":"Rethinking Local Perception in Lightweight Vision Transformer","code":"https://github.com/qhfan/CloFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":739,"model":"EfficientNet-B2","metrics":{"GFLOPs":"1","Number of params":"9.2M","Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":740,"model":"GC ViT-XXT","metrics":{"GFLOPs":"2.1","Number of params":"12M","Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2022-06-20","paper":"/paper/global-context-vision-transformers","paper_url":"https://arxiv.org/abs/2206.09959v5","paper_title":"Global Context Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":17,"n_unverified":19,"n_samples":36,"n_pointer_only_licence":15}},{"rank_in_archive_order":741,"model":"CSPResNeXt-50 (Mish+Aug)","metrics":{"Number of params":"20.5M","Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/cspnet-a-new-backbone-that-can-enhance","paper_url":"https://arxiv.org/abs/1911.11929v1","paper_title":"CSPNet: A New Backbone that can Enhance Learning Capability of CNN","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":123,"syntology":null},{"rank_in_archive_order":742,"model":"DAFT-full","metrics":{"Number of params":"22.6M","Top 1 Accuracy":"79.8%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/a-dot-product-attention-free-transformer","paper_url":"https://openreview.net/forum?id=JVR4JswsEM","paper_title":"A Dot Product Attention Free Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":743,"model":"DVT (T2T-ViT-10)","metrics":{"GFLOPs":"0.7","Top 1 Accuracy":"79.74%"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/not-all-images-are-worth-16x16-words-dynamic","paper_url":"https://arxiv.org/abs/2105.15075v2","paper_title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","code":"https://github.com/blackfeather-wang/Dynamic-Vision-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":744,"model":"NASViT-A1","metrics":{"GFLOPs":"0.309","Top 1 Accuracy":"79.7%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":745,"model":"GPaCo (ResNet-50)","metrics":{"Top 1 Accuracy":"79.7%"},"uses_additional_data":false,"paper_date":"2022-09-26","paper":"/paper/generalized-parametric-contrastive-learning","paper_url":"https://arxiv.org/abs/2209.12400v2","paper_title":"Generalized Parametric Contrastive Learning","code":"https://github.com/dvlab-research/parametric-contrastive-learning","n_code_links":4,"syntology":null},{"rank_in_archive_order":746,"model":"ResMLP-36","metrics":{"Number of params":"45M","Top 1 Accuracy":"79.7%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":747,"model":"Grafit (ResNet-50)","metrics":{"Top 1 Accuracy":"79.6%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/grafit-learning-fine-grained-image","paper_url":"https://arxiv.org/abs/2011.12982v1","paper_title":"Grafit: Learning fine-grained image representations with coarse labels","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":748,"model":"LeViT-128","metrics":{"GFLOPs":"0.376","Number of params":"8.8M","Top 1 Accuracy":"79.6%"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":749,"model":"ResT-Small","metrics":{"GFLOPs":"1.9","Number of params":"13.66M","Top 1 Accuracy":"79.6%"},"uses_additional_data":false,"paper_date":"2021-05-28","paper":"/paper/rest-an-efficient-transformer-for-visual","paper_url":"https://arxiv.org/abs/2105.13677v5","paper_title":"ResT: An Efficient Transformer for Visual Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":8,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":750,"model":"GTP-DeiT-S/P8","metrics":{"GFLOPs":"3.4","Top 1 Accuracy":"79.5%"},"uses_additional_data":false,"paper_date":"2023-11-06","paper":"/paper/gtp-vit-efficient-vision-transformers-via","paper_url":"https://arxiv.org/abs/2311.03035v2","paper_title":"GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation","code":"https://github.com/ackesnal/gtp-vit","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":751,"model":"ReXNet_1.3","metrics":{"GFLOPs":"0.66","Number of params":"7.6M","Top 1 Accuracy":"79.5%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":752,"model":"WideNet-L","metrics":{"Number of params":"40M","Top 1 Accuracy":"79.49%"},"uses_additional_data":false,"paper_date":"2021-07-25","paper":"/paper/go-wider-instead-of-deeper","paper_url":"https://arxiv.org/abs/2107.11817v3","paper_title":"Go Wider Instead of Deeper","code":"https://github.com/XueFuzhao/WideNet_Code","n_code_links":1,"syntology":null},{"rank_in_archive_order":753,"model":"ResNet-50 (SAMix)","metrics":{"Number of params":"25.6M","Top 1 Accuracy":"79.41%"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":754,"model":"AlphaNet-A3","metrics":{"GFLOPs":"0.357","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":755,"model":"MultiGrain R50-AA-500","metrics":{"Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":756,"model":"ResNet-50 (Adversarial Autoaugment)","metrics":{"Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2019-12-24","paper":"/paper/adversarial-autoaugment-1","paper_url":"https://arxiv.org/abs/1912.11188v1","paper_title":"Adversarial AutoAugment","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":757,"model":"ResMLP-24","metrics":{"Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":758,"model":"EdgeNeXt-S","metrics":{"GFLOPs":"2.6","Number of params":"5.6M","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2022-06-21","paper":"/paper/edgenext-efficiently-amalgamated-cnn","paper_url":"https://arxiv.org/abs/2206.10589v3","paper_title":"EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":759,"model":"TinyNet (GhostNet-A)","metrics":{"GFLOPs":"0.591","Number of params":"11.9M","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2020-10-28","paper":"/paper/model-rubik-s-cube-twisting-resolution-depth","paper_url":"https://arxiv.org/abs/2010.14819v2","paper_title":"Model Rubik's Cube: Twisting Resolution, Depth and Width for TinyNets","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":760,"model":"MobileOne-S4","metrics":{"GFLOPs":"2.978","Number of params":"14.8M","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":761,"model":"RegNetY-4.0GF","metrics":{"GFLOPs":"4","Number of params":"20.6M","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":762,"model":"SENet-50","metrics":{"Number of params":"28.02M","Top 1 Accuracy":"79.4%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":763,"model":"ScaleNet-152","metrics":{"GFLOPs":"11.2","Top 1 Accuracy":"79.38%"},"uses_additional_data":false,"paper_date":"2019-04-20","paper":"/paper/190409460","paper_url":"http://arxiv.org/abs/1904.09460v1","paper_title":"Data-Driven Neuron Allocation for Scale Aggregation Networks","code":"https://github.com/Eli-YiLi/ScaleNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":764,"model":"LIP-ResNet-101","metrics":{"Number of params":"42.9M","Top 1 Accuracy":"79.33%"},"uses_additional_data":false,"paper_date":"2019-08-12","paper":"/paper/lip-local-importance-based-pooling","paper_url":"https://arxiv.org/abs/1908.04156v3","paper_title":"LIP: Local Importance-based Pooling","code":"https://github.com/sebgao/LIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":765,"model":"MobileViTv3-S","metrics":{"GFLOPs":"1.841","Number of params":"5.8M","Top 1 Accuracy":"79.3%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":766,"model":"RedNet-152","metrics":{"GFLOPs":"6.8","Number of params":"34M","Top 1 Accuracy":"79.3%"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/involution-inverting-the-inherence-of","paper_url":"https://arxiv.org/abs/2103.06255v2","paper_title":"Involution: Inverting the Inherence of Convolution for Visual Recognition","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":13,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":4}},{"rank_in_archive_order":767,"model":"ResNet-50 (AutoMix)","metrics":{"Number of params":"25.6M","Top 1 Accuracy":"79.25%"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":768,"model":"PS-KD (ResNet-152 + CutMix)","metrics":{"Top 1 Accuracy":"79.24%"},"uses_additional_data":false,"paper_date":"2020-06-22","paper":"/paper/self-knowledge-distillation-a-simple-way-for","paper_url":"https://arxiv.org/abs/2006.12000v3","paper_title":"Self-Knowledge Distillation with Progressive Refinement of Targets","code":"https://github.com/lgcnsai/ps-kd-pytorch","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":769,"model":"ResNet-101 (JFT-300M Finetuning)","metrics":{"Top 1 Accuracy":"79.2%"},"uses_additional_data":false,"paper_date":"2017-07-10","paper":"/paper/revisiting-unreasonable-effectiveness-of-data","paper_url":"http://arxiv.org/abs/1707.02968v2","paper_title":"Revisiting Unreasonable Effectiveness of Data in Deep Learning Era","code":"https://github.com/Tencent/tencent-ml-images","n_code_links":2,"syntology":null},{"rank_in_archive_order":770,"model":"RVT-Ti*","metrics":{"GFLOPs":"1.3","Number of params":"10.9M","Top 1 Accuracy":"79.2%"},"uses_additional_data":false,"paper_date":"2021-05-17","paper":"/paper/rethinking-the-design-principles-of-robust","paper_url":"https://arxiv.org/abs/2105.07926v4","paper_title":"Towards Robust Vision Transformer","code":"https://github.com/alibaba/easyrobust","n_code_links":2,"syntology":null},{"rank_in_archive_order":771,"model":"Multiscale DEQ (MDEQ-XL)","metrics":{"Number of params":"81M","Top 1 Accuracy":"79.2%"},"uses_additional_data":false,"paper_date":"2020-06-15","paper":"/paper/multiscale-deep-equilibrium-models","paper_url":"https://arxiv.org/abs/2006.08656v2","paper_title":"Multiscale Deep Equilibrium Models","code":"https://github.com/locuslab/deq","n_code_links":4,"syntology":{"n_ran":10,"n_unverified":4,"n_samples":14,"n_pointer_only_licence":4}},{"rank_in_archive_order":772,"model":"DenseNet-169 (H4*)","metrics":{"Top 1 Accuracy":"79.152%"},"uses_additional_data":false,"paper_date":"2023-02-13","paper":"/paper/how-to-use-dropout-correctly-on-residual","paper_url":"https://arxiv.org/abs/2302.06112v1","paper_title":"How to Use Dropout Correctly on Residual Networks with Batch Normalization","code":"https://github.com/kmbmjn/DropoutCorrectly","n_code_links":1,"syntology":null},{"rank_in_archive_order":773,"model":"SimpleNetV1-5m-correct-labels","metrics":{"Number of params":"5.7M","Top 1 Accuracy":"79.12"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":774,"model":"AlphaNet-A2","metrics":{"GFLOPs":"0.317","Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":775,"model":"GhostNetV3 1.3x","metrics":{"Top 1 Accuracy":"79.1%","Top 5 Accuracy":"94.5"},"uses_additional_data":false,"paper_date":"2024-04-17","paper":"/paper/ghostnetv3-exploring-the-training-strategies","paper_url":"https://arxiv.org/abs/2404.11202v2","paper_title":"GhostNetV3: Exploring the Training Strategies for Compact Models","code":"https://github.com/james77777778/keras-image-models","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":776,"model":"AA-ResNet-152","metrics":{"Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2019-04-22","paper":"/paper/190409925","paper_url":"https://arxiv.org/abs/1904.09925v5","paper_title":"Attention Augmented Convolutional Networks","code":"https://github.com/leaderj1001/Attention-Augmented-Conv2d","n_code_links":14,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":777,"model":"FixResNet-50","metrics":{"Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2019-06-14","paper":"/paper/fixing-the-train-test-resolution-discrepancy","paper_url":"https://arxiv.org/abs/1906.06423v4","paper_title":"Fixing the train-test resolution discrepancy","code":"https://github.com/facebookresearch/FixRes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":778,"model":"MobileOne-S2 (distill)","metrics":{"Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":779,"model":"Diffusion Classifier","metrics":{"Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2023-03-28","paper":"/paper/your-diffusion-model-is-secretly-a-zero-shot","paper_url":"https://arxiv.org/abs/2303.16203v3","paper_title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","code":"https://github.com/diffusion-classifier/diffusion-classifier","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":1}},{"rank_in_archive_order":780,"model":"FastViT-T12","metrics":{"Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":781,"model":"TinyViT-5M","metrics":{"GFLOPs":"1.3","Number of params":"5.4M","Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2022-07-21","paper":"/paper/tinyvit-fast-pretraining-distillation-for","paper_url":"https://arxiv.org/abs/2207.10666v1","paper_title":"TinyViT: Fast Pretraining Distillation for Small Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":782,"model":"PiT-XS","metrics":{"GFLOPs":"1.4","Number of params":"10.6M","Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/rethinking-spatial-dimensions-of-vision","paper_url":"https://arxiv.org/abs/2103.16302v2","paper_title":"Rethinking Spatial Dimensions of Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":10,"n_unverified":10,"n_samples":20,"n_pointer_only_licence":0}},{"rank_in_archive_order":783,"model":"UniNet-B0","metrics":{"GFLOPs":"0.56","Number of params":"11.9M","Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2021-10-08","paper":"/paper/uninet-unified-architecture-search-with","paper_url":"https://arxiv.org/abs/2110.04035v1","paper_title":"UniNet: Unified Architecture Search with Convolution, Transformer, and MLP","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":784,"model":"RedNet-101","metrics":{"GFLOPs":"4.7","Number of params":"25.6M","Top 1 Accuracy":"79.1%"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/involution-inverting-the-inherence-of","paper_url":"https://arxiv.org/abs/2103.06255v2","paper_title":"Involution: Inverting the Inherence of Convolution for Visual Recognition","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":13,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":4}},{"rank_in_archive_order":785,"model":"ViT-B/16","metrics":{"GFLOPs":"16.87","Number of params":"86.6M","Top 1 Accuracy":"79.1"},"uses_additional_data":false,"paper_date":"2024-09-16","paper":"/paper/kolmogorov-arnold-transformer","paper_url":"https://arxiv.org/abs/2409.10594v1","paper_title":"Kolmogorov-Arnold Transformer","code":"https://github.com/Adamdad/kat","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":1,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":786,"model":"ResNet-50 (UDA)","metrics":{"Top 1 Accuracy":"79.04%"},"uses_additional_data":false,"paper_date":"2019-04-29","paper":"/paper/unsupervised-data-augmentation-1","paper_url":"https://arxiv.org/abs/1904.12848v6","paper_title":"Unsupervised Data Augmentation for Consistency Training","code":"https://github.com/google-research/uda","n_code_links":20,"syntology":{"n_ran":15,"n_unverified":37,"n_samples":52,"n_pointer_only_licence":9}},{"rank_in_archive_order":787,"model":"ScaleNet-101","metrics":{"GFLOPs":"7.5","Top 1 Accuracy":"79.03%"},"uses_additional_data":false,"paper_date":"2019-04-20","paper":"/paper/190409460","paper_url":"http://arxiv.org/abs/1904.09460v1","paper_title":"Data-Driven Neuron Allocation for Scale Aggregation Networks","code":"https://github.com/Eli-YiLi/ScaleNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":788,"model":"TransBoost-ResNet50","metrics":{"Top 1 Accuracy":"79.03%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":789,"model":"Co-ResNet-152","metrics":{"Number of params":"60M","Top 1 Accuracy":"79.03%"},"uses_additional_data":false,"paper_date":"2021-08-17","paper":"/paper/contextual-convolutional-neural-networks","paper_url":"https://arxiv.org/abs/2108.07387v1","paper_title":"Contextual Convolutional Neural Networks","code":"https://github.com/iduta/coconv","n_code_links":1,"syntology":null},{"rank_in_archive_order":790,"model":"MobileNetV3_large_x1_0_ssld","metrics":{"Number of params":"5.47M","Top 1 Accuracy":"79.0%"},"uses_additional_data":false,"paper_date":"2020-06-18","paper":"/paper/semi-supervised-recognition-under-a-noisy-and","paper_url":"https://arxiv.org/abs/2006.10702v1","paper_title":"Semi-Supervised Recognition under a Noisy and Fine-grained Dataset","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":1,"syntology":null},{"rank_in_archive_order":791,"model":"RevBiFPN-S2","metrics":{"GFLOPs":"1.37","Number of params":"10.6M","Top 1 Accuracy":"79%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":792,"model":"ConvMLP-M","metrics":{"Number of params":"17.4M","Top 1 Accuracy":"79%"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":793,"model":"Xception","metrics":{"Hardware Burden":"87G","Number of params":"22.855952M","Operations per network pass":"0.838G","Top 1 Accuracy":"79%"},"uses_additional_data":false,"paper_date":"2016-10-07","paper":"/paper/xception-deep-learning-with-depthwise","paper_url":"http://arxiv.org/abs/1610.02357v3","paper_title":"Xception: Deep Learning with Depthwise Separable Convolutions","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":41,"syntology":{"n_ran":1,"n_unverified":14,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":794,"model":"SpineNet-143","metrics":{"GFLOPs":"9.1","Number of params":"60.5M","Top 1 Accuracy":"79%"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":795,"model":"Mixer-B/8-SAM","metrics":{"Number of params":"64M","Top 1 Accuracy":"79%"},"uses_additional_data":false,"paper_date":"2021-06-03","paper":"/paper/when-vision-transformers-outperform-resnets","paper_url":"https://arxiv.org/abs/2106.01548v3","paper_title":"When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations","code":"https://github.com/google-research/vision_transformer","n_code_links":2,"syntology":null},{"rank_in_archive_order":796,"model":"InceptionV3 (FRN layer)","metrics":{"Top 1 Accuracy":"78.95%"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/filter-response-normalization-layer","paper_url":"https://arxiv.org/abs/1911.09737v2","paper_title":"Filter Response Normalization Layer: Eliminating Batch Dependence in the Training of Deep Neural Networks","code":"https://github.com/ensta-u2is/torch-uncertainty","n_code_links":16,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":797,"model":"ResNet-152 + SWA","metrics":{"Top 1 Accuracy":"78.94%"},"uses_additional_data":false,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":798,"model":"ECA-Net (ResNet-152)","metrics":{"GFLOPs":"10.83","Number of params":"57.40M","Top 1 Accuracy":"78.92%"},"uses_additional_data":false,"paper_date":"2019-10-08","paper":"/paper/eca-net-efficient-channel-attention-for-deep","paper_url":"https://arxiv.org/abs/1910.03151v4","paper_title":"ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":799,"model":"AlphaNet-A1","metrics":{"GFLOPs":"0.279","Top 1 Accuracy":"78.9%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":800,"model":"MixNet-L","metrics":{"GFLOPs":"0.565","Number of params":"7.3M","Top 1 Accuracy":"78.9%"},"uses_additional_data":false,"paper_date":"2019-07-22","paper":"/paper/mixnet-mixed-depthwise-convolutional-kernels","paper_url":"https://arxiv.org/abs/1907.09595v3","paper_title":"MixConv: Mixed Depthwise Convolutional Kernels","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":801,"model":"CeiT-T (384 finetune res)","metrics":{"GFLOPs":"3.6","Top 1 Accuracy":"78.8%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":802,"model":"Inception V3","metrics":{"Top 1 Accuracy":"78.8","Top 5 Accuracy":"94.4"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":803,"model":"NoisyStudent (EfficientNet-B0)","metrics":{"Number of params":"5.3M","Top 1 Accuracy":"78.8%"},"uses_additional_data":false,"paper_date":"2019-11-11","paper":"/paper/self-training-with-noisy-student-improves","paper_url":"https://arxiv.org/abs/1911.04252v4","paper_title":"Self-training with Noisy Student improves ImageNet classification","code":"https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet","n_code_links":13,"syntology":{"n_ran":5,"n_unverified":19,"n_samples":24,"n_pointer_only_licence":0}},{"rank_in_archive_order":804,"model":"EfficientNet-B1","metrics":{"GFLOPs":"0.7","Number of params":"7.8M","Top 1 Accuracy":"78.8%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":805,"model":"ResNet-50","metrics":{"Number of params":"25.5M","Top 1 Accuracy":"78.8%"},"uses_additional_data":false,"paper_date":"2021-01-27","paper":"/paper/bottleneck-transformers-for-visual","paper_url":"https://arxiv.org/abs/2101.11605v2","paper_title":"Bottleneck Transformers for Visual Recognition","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":26,"n_unverified":23,"n_samples":49,"n_pointer_only_licence":8}},{"rank_in_archive_order":806,"model":"SGE-ResNet101","metrics":{"GFLOPs":"7.858","Number of params":"44.55M","Top 1 Accuracy":"78.798%"},"uses_additional_data":false,"paper_date":"2019-05-23","paper":"/paper/spatial-group-wise-enhance-improving-semantic","paper_url":"https://arxiv.org/abs/1905.09646v2","paper_title":"Spatial Group-wise Enhance: Improving Semantic Feature Learning in Convolutional Networks","code":"https://github.com/implus/PytorchInsight","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":807,"model":"RepVGG-B2","metrics":{"GFLOPs":"18.4","Number of params":"80.31M","Top 1 Accuracy":"78.78%"},"uses_additional_data":false,"paper_date":"2021-01-11","paper":"/paper/repvgg-making-vgg-style-convnets-great-again","paper_url":"https://arxiv.org/abs/2101.03697v3","paper_title":"RepVGG: Making VGG-style ConvNets Great Again","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":25,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":6}},{"rank_in_archive_order":808,"model":"ResNet-50","metrics":{"Top 1 Accuracy":"78.76%"},"uses_additional_data":false,"paper_date":"2020-09-15","paper":"/paper/puzzle-mix-exploiting-saliency-and-local-1","paper_url":"https://arxiv.org/abs/2009.06962v2","paper_title":"Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup","code":"https://github.com/snu-mllab/PuzzleMix","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":809,"model":"SAMix+DM (ResNet-50 RSB A3)","metrics":{"Top 1 Accuracy":"78.75%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":810,"model":"ResNet-50","metrics":{"Top 1 Accuracy":"78.7%"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":811,"model":"CAS-ViT-XS","metrics":{"GFLOPs":"0.56","Number of params":"3.2M","Top 1 Accuracy":"78.7%"},"uses_additional_data":false,"paper_date":"2024-08-07","paper":"/paper/cas-vit-convolutional-additive-self-attention","paper_url":"https://arxiv.org/abs/2408.03703v2","paper_title":"CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications","code":"https://github.com/tianfang-zhang/cas-vit","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":812,"model":"SReT-LT (Fast Knowledge Distillation)","metrics":{"GFLOPs":"1.2","Number of params":"5M","Top 1 Accuracy":"78.7%"},"uses_additional_data":false,"paper_date":"2021-12-02","paper":"/paper/a-fast-knowledge-distillation-framework-for","paper_url":"https://arxiv.org/abs/2112.01528v1","paper_title":"A Fast Knowledge Distillation Framework for Visual Recognition","code":"https://github.com/szq0214/MEAL-V2","n_code_links":2,"syntology":null},{"rank_in_archive_order":813,"model":"PVTv2-B1","metrics":{"GFLOPs":"2.1","Number of params":"13.1M","Top 1 Accuracy":"78.7%"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":814,"model":"ECA-Net (ResNet-101)","metrics":{"GFLOPs":"7.35","Number of params":"42.49M","Top 1 Accuracy":"78.65%"},"uses_additional_data":false,"paper_date":"2019-10-08","paper":"/paper/eca-net-efficient-channel-attention-for-deep","paper_url":"https://arxiv.org/abs/1910.03151v4","paper_title":"ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":815,"model":"MobileViTv3-1.0","metrics":{"GFLOPs":"1.876","Top 1 Accuracy":"78.64%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":816,"model":"EdgeFormer-S","metrics":{"GFLOPs":"3.48","Number of params":"5M","Top 1 Accuracy":"78.63%"},"uses_additional_data":false,"paper_date":"2022-03-08","paper":"/paper/edgeformer-improving-light-weight-convnets-by","paper_url":"https://arxiv.org/abs/2203.03952v5","paper_title":"ParC-Net: Position Aware Circular Convolution with Merits from ConvNets and Transformer","code":"https://github.com/hkzhang91/parc-net","n_code_links":3,"syntology":{"n_ran":5,"n_unverified":0,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":817,"model":"AutoMix+DM (ResNet-50 RSB A3)","metrics":{"Top 1 Accuracy":"78.62%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":818,"model":"UniRepLKNet-F","metrics":{"Top 1 Accuracy":"78.6%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":819,"model":"CSAT","metrics":{"Number of params":"3M","Top 1 Accuracy":"78.6"},"uses_additional_data":false,"paper_date":"2023-10-29","paper":"/paper/rckd-response-based-cross-task-knowledge","paper_url":"https://www.mdpi.com/2306-5354/10/11/1279","paper_title":"RCKD: Response-Based Cross-Task Knowledge Distillation for Pathological Image Analysis","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":820,"model":"TransBoost-EfficientNetB0","metrics":{"Number of params":"5.29M","Top 1 Accuracy":"78.60%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":821,"model":"Visformer-Ti","metrics":{"GFLOPs":"1.3","Number of params":"10.3M","Top 1 Accuracy":"78.6%"},"uses_additional_data":false,"paper_date":"2021-04-26","paper":"/paper/visformer-the-vision-friendly-transformer","paper_url":"https://arxiv.org/abs/2104.12533v4","paper_title":"Visformer: The Vision-friendly Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":822,"model":"ResMLP-12 (distilled, class-MLP)","metrics":{"GFLOPs":"3","Number of params":"17.7M","Top 1 Accuracy":"78.6%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":823,"model":"RepMLP-Res50","metrics":{"Number of params":"52.77M","Top 1 Accuracy":"78.60%"},"uses_additional_data":false,"paper_date":"2021-05-05","paper":"/paper/repmlp-re-parameterizing-convolutions-into","paper_url":"https://arxiv.org/abs/2105.01883v3","paper_title":"RepMLP: Re-parameterizing Convolutions into Fully-connected Layers for Image Recognition","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":10,"syntology":{"n_ran":2,"n_unverified":12,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":824,"model":"Res2Net-50-299","metrics":{"Top 1 Accuracy":"78.59%"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/res2net-a-new-multi-scale-backbone","paper_url":"https://arxiv.org/abs/1904.01169v3","paper_title":"Res2Net: A New Multi-scale Backbone Architecture","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":34,"syntology":{"n_ran":3,"n_unverified":6,"n_samples":9,"n_pointer_only_licence":9}},{"rank_in_archive_order":825,"model":"ResNet-152","metrics":{"GFLOPs":"11.3","Top 1 Accuracy":"78.57%"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":826,"model":"ResNet-50-DW (Deformable Kernels)","metrics":{"Top 1 Accuracy":"78.5%"},"uses_additional_data":false,"paper_date":"2019-10-07","paper":"/paper/deformable-kernels-adapting-effective","paper_url":"https://arxiv.org/abs/1910.02940v2","paper_title":"Deformable Kernels: Adapting Effective Receptive Fields for Object Deformation","code":"https://github.com/hangg7/deformable-kernels","n_code_links":2,"syntology":null},{"rank_in_archive_order":827,"model":"HRFormer-T","metrics":{"GFLOPs":"1.8","Number of params":"8.0M","Top 1 Accuracy":"78.5%"},"uses_additional_data":false,"paper_date":"2021-10-18","paper":"/paper/hrformer-high-resolution-transformer-for","paper_url":"https://arxiv.org/abs/2110.09408v3","paper_title":"HRFormer: High-Resolution Transformer for Dense Prediction","code":"https://github.com/HRNet/HRFormer","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":4,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":828,"model":"HCGNet-B","metrics":{"GFLOPs":"2.0","Number of params":"12.9M","Top 1 Accuracy":"78.5%"},"uses_additional_data":false,"paper_date":"2019-08-26","paper":"/paper/gated-convolutional-networks-with-hybrid","paper_url":"https://arxiv.org/abs/1908.09699v3","paper_title":"Gated Convolutional Networks with Hybrid Connectivity for Image Classification","code":"https://github.com/winycg/HCGNet","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":829,"model":"RepVGG-B2g4","metrics":{"GFLOPs":"11.3","Number of params":"55.77M","Top 1 Accuracy":"78.5%"},"uses_additional_data":false,"paper_date":"2021-01-11","paper":"/paper/repvgg-making-vgg-style-convnets-great-again","paper_url":"https://arxiv.org/abs/2101.03697v3","paper_title":"RepVGG: Making VGG-style ConvNets Great Again","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":25,"syntology":{"n_ran":13,"n_unverified":3,"n_samples":16,"n_pointer_only_licence":6}},{"rank_in_archive_order":830,"model":"DVT (T2T-ViT-7)","metrics":{"GFLOPs":"0.6","Top 1 Accuracy":"78.48%"},"uses_additional_data":false,"paper_date":"2021-05-31","paper":"/paper/not-all-images-are-worth-16x16-words-dynamic","paper_url":"https://arxiv.org/abs/2105.15075v2","paper_title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","code":"https://github.com/blackfeather-wang/Dynamic-Vision-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":831,"model":"SRM-ResNet-101","metrics":{"Top 1 Accuracy":"78.47%"},"uses_additional_data":false,"paper_date":"2019-03-26","paper":"/paper/srm-a-style-based-recalibration-module-for","paper_url":"http://arxiv.org/abs/1903.10829v1","paper_title":"SRM : A Style-based Recalibration Module for Convolutional Neural Networks","code":"https://github.com/EvgenyKashin/SRMnet","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":832,"model":"DenseNet-161 + SWA","metrics":{"Top 1 Accuracy":"78.44%"},"uses_additional_data":false,"paper_date":"2018-03-14","paper":"/paper/averaging-weights-leads-to-wider-optima-and","paper_url":"http://arxiv.org/abs/1803.05407v3","paper_title":"Averaging Weights Leads to Wider Optima and Better Generalization","code":"https://github.com/timgaripov/swa","n_code_links":17,"syntology":{"n_ran":5,"n_unverified":4,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":833,"model":"CoaT-Ti","metrics":{"Top 1 Accuracy":"78.42%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":834,"model":"FBNetV5-AC-CLS","metrics":{"GFLOPs":"0.280","Top 1 Accuracy":"78.4%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":835,"model":"ResNet-50 (CutMix)","metrics":{"Top 1 Accuracy":"78.4%"},"uses_additional_data":false,"paper_date":"2019-05-13","paper":"/paper/cutmix-regularization-strategy-to-train","paper_url":"https://arxiv.org/abs/1905.04899v2","paper_title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":30,"syntology":{"n_ran":17,"n_unverified":7,"n_samples":24,"n_pointer_only_licence":5}},{"rank_in_archive_order":836,"model":"ReXNet_1.0-relabel","metrics":{"Number of params":"4.8M","Top 1 Accuracy":"78.4%"},"uses_additional_data":false,"paper_date":"2021-01-13","paper":"/paper/re-labeling-imagenet-from-single-to-multi","paper_url":"https://arxiv.org/abs/2101.05022v2","paper_title":"Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels","code":"https://github.com/naver-ai/relabel_imagenet","n_code_links":2,"syntology":null},{"rank_in_archive_order":837,"model":"MobileViT-S","metrics":{"Number of params":"5.6M","Top 1 Accuracy":"78.4%"},"uses_additional_data":false,"paper_date":"2021-10-05","paper":"/paper/mobilevit-light-weight-general-purpose-and","paper_url":"https://arxiv.org/abs/2110.02178v2","paper_title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":31,"syntology":{"n_ran":53,"n_unverified":15,"n_samples":68,"n_pointer_only_licence":18}},{"rank_in_archive_order":838,"model":"RedNet-50","metrics":{"GFLOPs":"2.7","Number of params":"15.5M","Top 1 Accuracy":"78.4%"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/involution-inverting-the-inherence-of","paper_url":"https://arxiv.org/abs/2103.06255v2","paper_title":"Involution: Inverting the Inherence of Convolution for Visual Recognition","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":13,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":4}},{"rank_in_archive_order":839,"model":"ResNet-50 (SAMix+DM)","metrics":{"Top 1 Accuracy":"78.36%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":840,"model":"ResNet-50 + DropBlock (0.9 kp, 0.1 label smoothing)","metrics":{"Top 1 Accuracy":"78.35%"},"uses_additional_data":false,"paper_date":"2018-10-30","paper":"/paper/dropblock-a-regularization-method-for","paper_url":"http://arxiv.org/abs/1810.12890v1","paper_title":"DropBlock: A regularization method for convolutional networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":null},{"rank_in_archive_order":841,"model":"Poly-SA-ViT-S","metrics":{"Top 1 Accuracy":"78.34%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":842,"model":"EfficientNet-B0 (CondConv)","metrics":{"GFLOPs":"0.826","Top 1 Accuracy":"78.3%"},"uses_additional_data":false,"paper_date":"2019-04-10","paper":"/paper/soft-conditional-computation","paper_url":"https://arxiv.org/abs/1904.04971v3","paper_title":"CondConv: Conditionally Parameterized Convolutions for Efficient Inference","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":9,"syntology":null},{"rank_in_archive_order":843,"model":"ResNet-101","metrics":{"GFLOPs":"7.6","Number of params":"40M","Top 1 Accuracy":"78.25%"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":844,"model":"NASViT-A0","metrics":{"GFLOPs":"0.208","Top 1 Accuracy":"78.2%"},"uses_additional_data":false,"paper_date":"2021-09-29","paper":"/paper/nasvit-neural-architecture-search-for","paper_url":"https://openreview.net/forum?id=Qaw16njk6L","paper_title":"NASViT: Neural Architecture Search for Efficient Vision Transformers with Gradient Conflict aware Supernet Training","code":"https://github.com/facebookresearch/NASViT","n_code_links":1,"syntology":null},{"rank_in_archive_order":845,"model":"MultiGrain R50-AA-224","metrics":{"Top 1 Accuracy":"78.2%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":846,"model":"Pyramid ViG-Ti","metrics":{"GFLOPs":"1.7","Number of params":"10.7M","Top 1 Accuracy":"78.2%"},"uses_additional_data":false,"paper_date":"2022-06-01","paper":"/paper/vision-gnn-an-image-is-worth-graph-of-nodes","paper_url":"https://arxiv.org/abs/2206.00272v3","paper_title":"Vision GNN: An Image is Worth Graph of Nodes","code":"https://github.com/huawei-noah/efficient-ai-backbones","n_code_links":9,"syntology":{"n_ran":19,"n_unverified":15,"n_samples":34,"n_pointer_only_licence":22}},{"rank_in_archive_order":847,"model":"LocalViT-PVT","metrics":{"GFLOPs":"4.8","Number of params":"13.5M","Top 1 Accuracy":"78.2%"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/localvit-bringing-locality-to-vision","paper_url":"https://arxiv.org/abs/2104.05707v1","paper_title":"LocalViT: Bringing Locality to Vision Transformers","code":"https://github.com/ofsoundof/LocalViT","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":848,"model":"ResNet-50 (AutoMix+DM)","metrics":{"Top 1 Accuracy":"78.15%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":849,"model":"PuzzleMix+DM (ResNet-50 RSB A3)","metrics":{"Top 1 Accuracy":"78.15%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":850,"model":"ResNet-50 (LIP Bottleneck-256)","metrics":{"Number of params":"25.8M","Top 1 Accuracy":"78.15%"},"uses_additional_data":false,"paper_date":"2019-08-12","paper":"/paper/lip-local-importance-based-pooling","paper_url":"https://arxiv.org/abs/1908.04156v3","paper_title":"LIP: Local Importance-based Pooling","code":"https://github.com/sebgao/LIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":851,"model":"WRN-50-2-bottleneck","metrics":{"Top 1 Accuracy":"78.1%"},"uses_additional_data":false,"paper_date":"2016-05-23","paper":"/paper/wide-residual-networks","paper_url":"http://arxiv.org/abs/1605.07146v4","paper_title":"Wide Residual Networks","code":"https://github.com/tensorflow/models/tree/master/research/autoaugment","n_code_links":72,"syntology":{"n_ran":60,"n_unverified":36,"n_samples":96,"n_pointer_only_licence":46}},{"rank_in_archive_order":852,"model":"MobileViTv2-1.0","metrics":{"GFLOPs":"1.8","Number of params":"4.9M","Top 1 Accuracy":"78.1%"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/separable-self-attention-for-mobile-vision","paper_url":"https://arxiv.org/abs/2206.02680v1","paper_title":"Separable Self-attention for Mobile Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":853,"model":"MobileOne-S3","metrics":{"GFLOPs":"1.896","Number of params":"10.1M","Top 1 Accuracy":"78.1%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":854,"model":"ResNet50 (A3)","metrics":{"Number of params":"25M","Top 1 Accuracy":"78.1%"},"uses_additional_data":false,"paper_date":"2021-10-01","paper":"/paper/resnet-strikes-back-an-improved-training","paper_url":"https://arxiv.org/abs/2110.00476v1","paper_title":"ResNet strikes back: An improved training procedure in timm","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":14,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":855,"model":"ZenNet-400M-SE","metrics":{"GFLOPs":"0.820","Number of params":"5.7M","Top 1 Accuracy":"78%"},"uses_additional_data":false,"paper_date":"2021-02-01","paper":"/paper/zen-nas-a-zero-shot-nas-for-high-performance","paper_url":"https://arxiv.org/abs/2102.01063v4","paper_title":"Zen-NAS: A Zero-Shot NAS for High-Performance Deep Image Recognition","code":"https://github.com/alibaba/lightweight-neural-architecture-search","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":856,"model":"RegNetY-1.6GF","metrics":{"GFLOPs":"1.6","Number of params":"11.2M","Top 1 Accuracy":"78%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":857,"model":"HVT-S-1","metrics":{"GFLOPs":"2.4","Number of params":"21.74M","Top 1 Accuracy":"78.00%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/scalable-visual-transformers-with","paper_url":"https://arxiv.org/abs/2103.10619v2","paper_title":"Scalable Vision Transformers with Hierarchical Pooling","code":"https://github.com/BR-IDL/PaddleViT","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":858,"model":"Perceiver (FF)","metrics":{"GFLOPs":"707.2","Number of params":"44.9M","Top 1 Accuracy":"78%"},"uses_additional_data":false,"paper_date":"2021-03-04","paper":"/paper/perceiver-general-perception-with-iterative","paper_url":"https://arxiv.org/abs/2103.03206v2","paper_title":"Perceiver: General Perception with Iterative Attention","code":"https://github.com/deepmind/deepmind-research/tree/master/perceiver","n_code_links":12,"syntology":{"n_ran":41,"n_unverified":14,"n_samples":55,"n_pointer_only_licence":11}},{"rank_in_archive_order":859,"model":"ReXNet_1.0","metrics":{"GFLOPs":"0.40","Number of params":"4.8M","Top 1 Accuracy":"77.9%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":860,"model":"ViTAE-6M","metrics":{"GFLOPs":"4","Number of params":"6.5M","Top 1 Accuracy":"77.9%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":861,"model":"DenseNet-264","metrics":{"Top 1 Accuracy":"77.85%"},"uses_additional_data":false,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":18,"n_unverified":53,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":862,"model":"AlphaNet-A0","metrics":{"GFLOPs":"0.203","Top 1 Accuracy":"77.8%"},"uses_additional_data":false,"paper_date":"2021-02-16","paper":"/paper/alphanet-improved-training-of-supernet-with","paper_url":"https://arxiv.org/abs/2102.07954v2","paper_title":"AlphaNet: Improved Training of Supernets with Alpha-Divergence","code":"https://github.com/facebookresearch/AttentiveNAS","n_code_links":2,"syntology":{"n_ran":16,"n_unverified":15,"n_samples":31,"n_pointer_only_licence":31}},{"rank_in_archive_order":863,"model":"ScaleNet-50","metrics":{"GFLOPs":"3.8","Top 1 Accuracy":"77.8%"},"uses_additional_data":false,"paper_date":"2019-04-20","paper":"/paper/190409460","paper_url":"http://arxiv.org/abs/1904.09460v1","paper_title":"Data-Driven Neuron Allocation for Scale Aggregation Networks","code":"https://github.com/Eli-YiLi/ScaleNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":864,"model":"ResMLP-S12","metrics":{"Number of params":"15.4M","Top 1 Accuracy":"77.8%"},"uses_additional_data":false,"paper_date":"2021-05-07","paper":"/paper/resmlp-feedforward-networks-for-image","paper_url":"https://arxiv.org/abs/2105.03404v2","paper_title":"ResMLP: Feedforward networks for image classification with data-efficient training","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":19,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":865,"model":"ResNet-50 (PuzzleMix+DM)","metrics":{"Top 1 Accuracy":"77.71%"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":866,"model":"TinyNet-A + RA","metrics":{"GFLOPs":"0.339","Number of params":"5.1M","Top 1 Accuracy":"77.7%"},"uses_additional_data":false,"paper_date":"2020-10-28","paper":"/paper/model-rubik-s-cube-twisting-resolution-depth","paper_url":"https://arxiv.org/abs/2010.14819v2","paper_title":"Model Rubik's Cube: Twisting Resolution, Depth and Width for TinyNets","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":867,"model":"ResNet-50 (Fast AA)","metrics":{"Top 1 Accuracy":"77.6%"},"uses_additional_data":false,"paper_date":"2019-05-01","paper":"/paper/fast-autoaugment","paper_url":"https://arxiv.org/abs/1905.00397v2","paper_title":"Fast AutoAugment","code":"https://github.com/kakaobrain/fast-autoaugment","n_code_links":11,"syntology":{"n_ran":22,"n_unverified":18,"n_samples":40,"n_pointer_only_licence":3}},{"rank_in_archive_order":868,"model":"SReT-T","metrics":{"GFLOPs":"1.1","Number of params":"4.8M","Top 1 Accuracy":"77.6%"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/sliced-recursive-transformer-1","paper_url":"https://arxiv.org/abs/2111.05297v3","paper_title":"Sliced Recursive Transformer","code":"https://github.com/szq0214/sret","n_code_links":1,"syntology":null},{"rank_in_archive_order":869,"model":"RedNet-38","metrics":{"GFLOPs":"2.2","Number of params":"12.4M","Top 1 Accuracy":"77.6%"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/involution-inverting-the-inherence-of","paper_url":"https://arxiv.org/abs/2103.06255v2","paper_title":"Involution: Inverting the Inherence of Convolution for Visual Recognition","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":13,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":4}},{"rank_in_archive_order":870,"model":"SGE-ResNet50","metrics":{"GFLOPs":"4.127","Number of params":"25.56M","Top 1 Accuracy":"77.584%"},"uses_additional_data":false,"paper_date":"2019-05-23","paper":"/paper/spatial-group-wise-enhance-improving-semantic","paper_url":"https://arxiv.org/abs/1905.09646v2","paper_title":"Spatial Group-wise Enhance: Improving Semantic Feature Learning in Convolutional Networks","code":"https://github.com/implus/PytorchInsight","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":4}},{"rank_in_archive_order":871,"model":"WideNet-B","metrics":{"Number of params":"29M","Top 1 Accuracy":"77.54%"},"uses_additional_data":false,"paper_date":"2021-07-25","paper":"/paper/go-wider-instead-of-deeper","paper_url":"https://arxiv.org/abs/2107.11817v3","paper_title":"Go Wider Instead of Deeper","code":"https://github.com/XueFuzhao/WideNet_Code","n_code_links":1,"syntology":null},{"rank_in_archive_order":872,"model":"EfficientNet-B0","metrics":{"Top 1 Accuracy":"77.5%"},"uses_additional_data":false,"paper_date":"2021-01-05","paper":"/paper/autodropout-learning-dropout-patterns-to","paper_url":"https://arxiv.org/abs/2101.01761v1","paper_title":"AutoDropout: Learning Dropout Patterns to Regularize Deep Networks","code":"https://github.com/google-research/google-research","n_code_links":1,"syntology":null},{"rank_in_archive_order":873,"model":"ACNet (ResNet-50)","metrics":{"Number of params":"29.38M","Top 1 Accuracy":"77.5%"},"uses_additional_data":false,"paper_date":"2019-04-07","paper":"/paper/adaptively-connected-neural-networks","paper_url":"http://arxiv.org/abs/1904.03579v1","paper_title":"Adaptively Connected Neural Networks","code":"https://github.com/wanggrun/Adaptively-Connected-Neural-Networks","n_code_links":1,"syntology":null},{"rank_in_archive_order":874,"model":"ECA-Net (ResNet-50)","metrics":{"GFLOPs":"3.86","Number of params":"24.37M","Top 1 Accuracy":"77.48%"},"uses_additional_data":false,"paper_date":"2019-10-08","paper":"/paper/eca-net-efficient-channel-attention-for-deep","paper_url":"https://arxiv.org/abs/1910.03151v4","paper_title":"ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":875,"model":"DenseNet-201","metrics":{"Top 1 Accuracy":"77.42%"},"uses_additional_data":false,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":18,"n_unverified":53,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":876,"model":"MobileOne-S2","metrics":{"GFLOPs":"1.299","Number of params":"7.8M","Top 1 Accuracy":"77.4%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":877,"model":"R-Mix (ResNet-50)","metrics":{"Top 1 Accuracy":"77.39%"},"uses_additional_data":false,"paper_date":"2022-12-09","paper":"/paper/expeditious-saliency-guided-mix-up-through","paper_url":"https://arxiv.org/abs/2212.04875v3","paper_title":"Expeditious Saliency-guided Mix-up through Random Gradient Thresholding","code":"https://github.com/minhlong94/random-mixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":878,"model":"ResnetV2 50 (FRN layer)","metrics":{"Top 1 Accuracy":"77.21%"},"uses_additional_data":false,"paper_date":"2019-11-21","paper":"/paper/filter-response-normalization-layer","paper_url":"https://arxiv.org/abs/1911.09737v2","paper_title":"Filter Response Normalization Layer: Eliminating Batch Dependence in the Training of Deep Neural Networks","code":"https://github.com/ensta-u2is/torch-uncertainty","n_code_links":16,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":879,"model":"FBNetV5-AR-CLS","metrics":{"GFLOPs":"0.215","Top 1 Accuracy":"77.2%"},"uses_additional_data":false,"paper_date":"2021-11-19","paper":"/paper/fbnetv5-neural-architecture-search-for","paper_url":"https://arxiv.org/abs/2111.10007v3","paper_title":"FBNetV5: Neural Architecture Search for Multiple Tasks in One Run","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":880,"model":"MogaNet-XT (256res)","metrics":{"GFLOPs":"1.04","Number of params":"3M","Top 1 Accuracy":"77.2%"},"uses_additional_data":false,"paper_date":"2022-11-07","paper":"/paper/efficient-multi-order-gated-aggregation","paper_url":"https://arxiv.org/abs/2211.03295v3","paper_title":"MogaNet: Multi-order Gated Aggregation Network","code":"https://github.com/chengtan9907/OpenSTL","n_code_links":7,"syntology":{"n_ran":12,"n_unverified":3,"n_samples":15,"n_pointer_only_licence":0}},{"rank_in_archive_order":881,"model":"ReXNet_0.9","metrics":{"GFLOPs":"0.35","Number of params":"4.1M","Top 1 Accuracy":"77.2%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":882,"model":"Prodpoly","metrics":{"Top 1 Accuracy":"77.17%"},"uses_additional_data":false,"paper_date":"2020-06-20","paper":"/paper/deep-polynomial-neural-networks","paper_url":"https://arxiv.org/abs/2006.13026v2","paper_title":"Deep Polynomial Neural Networks","code":"https://github.com/Faceplugin-ltd/FaceRecognition-Android","n_code_links":5,"syntology":null},{"rank_in_archive_order":883,"model":"ResNet-50-D","metrics":{"Number of params":"25M","Top 1 Accuracy":"77.16%"},"uses_additional_data":false,"paper_date":"2018-12-04","paper":"/paper/bag-of-tricks-for-image-classification-with","paper_url":"http://arxiv.org/abs/1812.01187v2","paper_title":"Bag of Tricks for Image Classification with Convolutional Neural Networks","code":"https://github.com/PaddlePaddle/PaddleOCR","n_code_links":28,"syntology":{"n_ran":4,"n_unverified":11,"n_samples":15,"n_pointer_only_licence":5}},{"rank_in_archive_order":884,"model":"Inception v3","metrics":{"Top 1 Accuracy":"77.12%"},"uses_additional_data":false,"paper_date":"2018-03-22","paper":"/paper/what-do-deep-networks-like-to-see","paper_url":"http://arxiv.org/abs/1803.08337v1","paper_title":"What do Deep Networks Like to See?","code":"https://github.com/spalaciob/s2snets-reconstruction","n_code_links":1,"syntology":null},{"rank_in_archive_order":885,"model":"GhostNetV3 1.0x","metrics":{"Top 1 Accuracy":"77.1%","Top 5 Accuracy":"93.3"},"uses_additional_data":false,"paper_date":"2024-04-17","paper":"/paper/ghostnetv3-exploring-the-training-strategies","paper_url":"https://arxiv.org/abs/2404.11202v2","paper_title":"GhostNetV3: Exploring the Training Strategies for Compact Models","code":"https://github.com/james77777778/keras-image-models","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":886,"model":"MKD ViT-T","metrics":{"Top 1 Accuracy":"77.1%"},"uses_additional_data":false,"paper_date":"2022-02-16","paper":"/paper/meta-knowledge-distillation","paper_url":"https://arxiv.org/abs/2202.07940v1","paper_title":"Meta Knowledge Distillation","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":887,"model":"GreedyNAS-A","metrics":{"GFLOPs":"0.366","Number of params":"6.5M","Top 1 Accuracy":"77.1%"},"uses_additional_data":false,"paper_date":"2020-03-25","paper":"/paper/greedynas-towards-fast-one-shot-nas-with","paper_url":"https://arxiv.org/abs/2003.11236v1","paper_title":"GreedyNAS: Towards Fast One-Shot NAS with Greedy Supernet","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":888,"model":"SkipblockNet-L","metrics":{"GFLOPs":"0.364","Number of params":"7.1M","Top 1 Accuracy":"77.1%"},"uses_additional_data":false,"paper_date":"2021-07-23","paper":"/paper/bias-loss-for-mobile-neural-networks","paper_url":"https://arxiv.org/abs/2107.11170v3","paper_title":"Bias Loss for Mobile Neural Networks","code":"https://github.com/lusinlu/biasloss_skipblocknet","n_code_links":2,"syntology":null},{"rank_in_archive_order":889,"model":"CI2P-ViT","metrics":{"GFLOPs":"6.442","Top 1 Accuracy":"77%"},"uses_additional_data":false,"paper_date":"2025-02-14","paper":"/paper/compress-image-to-patches-for-vision","paper_url":"https://arxiv.org/abs/2502.10120v1","paper_title":"Compress image to patches for Vision Transformer","code":"https://github.com/fanchy/ci2pvit","n_code_links":1,"syntology":null},{"rank_in_archive_order":890,"model":"SSAL-Resnet50","metrics":{"Top 1 Accuracy":"77.0%"},"uses_additional_data":false,"paper_date":"2021-01-07","paper":"/paper/contextual-classification-using-self","paper_url":"https://arxiv.org/abs/2101.03057v1","paper_title":"Contextual Classification Using Self-Supervised Auxiliary Models for Deep Neural Networks","code":"https://github.com/Engler93/Self-Supervised-Autogenous-Learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":891,"model":"UniRepLKNet-A","metrics":{"Top 1 Accuracy":"77%"},"uses_additional_data":false,"paper_date":"2023-11-27","paper":"/paper/unireplknet-a-universal-perception-large","paper_url":"https://arxiv.org/abs/2311.15599v2","paper_title":"UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition","code":"https://github.com/ailab-cvc/unireplknet","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":892,"model":"CloFormer-XXS","metrics":{"GFLOPs":"0.6","Number of params":"4.2M","Top 1 Accuracy":"77%"},"uses_additional_data":false,"paper_date":"2023-03-31","paper":"/paper/rethinking-local-perception-in-lightweight","paper_url":"https://arxiv.org/abs/2303.17803v5","paper_title":"Rethinking Local Perception in Lightweight Vision Transformer","code":"https://github.com/qhfan/CloFormer","n_code_links":1,"syntology":null},{"rank_in_archive_order":893,"model":"MixNet-M","metrics":{"GFLOPs":"0.360","Number of params":"5.0M","Top 1 Accuracy":"77%"},"uses_additional_data":false,"paper_date":"2019-07-22","paper":"/paper/mixnet-mixed-depthwise-convolutional-kernels","paper_url":"https://arxiv.org/abs/1907.09595v3","paper_title":"MixConv: Mixed Depthwise Convolutional Kernels","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":894,"model":"ResNet50 (FSGDM)","metrics":{"Top 1 Accuracy":"76.91%"},"uses_additional_data":false,"paper_date":"2024-11-29","paper":"/paper/on-the-performance-analysis-of-momentum","paper_url":"https://arxiv.org/abs/2411.19671v6","paper_title":"On the Performance Analysis of Momentum Method: A Frequency Domain Perspective","code":"https://github.com/yinleung/FSGDM","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":895,"model":"SCARLET-A","metrics":{"GFLOPs":"0.730","Number of params":"6.7M","Top 1 Accuracy":"76.9%"},"uses_additional_data":false,"paper_date":"2019-08-16","paper":"/paper/scarletnas-bridging-the-gap-between","paper_url":"https://arxiv.org/abs/1908.06022v6","paper_title":"SCARLET-NAS: Bridging the Gap between Stability and Scalability in Weight-sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/SCARLET-NAS","n_code_links":1,"syntology":null},{"rank_in_archive_order":896,"model":"TransBoost-MobileNetV3-L","metrics":{"Number of params":"5.48M","Top 1 Accuracy":"76.81%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":897,"model":"ViTAE-T-Stage","metrics":{"GFLOPs":"4.6","Number of params":"4.8M","Top 1 Accuracy":"76.8%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":898,"model":"GreedyNAS-B","metrics":{"GFLOPs":"0.324","Number of params":"5.2M","Top 1 Accuracy":"76.8%"},"uses_additional_data":false,"paper_date":"2020-03-25","paper":"/paper/greedynas-towards-fast-one-shot-nas-with","paper_url":"https://arxiv.org/abs/2003.11236v1","paper_title":"GreedyNAS: Towards Fast One-Shot NAS with Greedy Supernet","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":899,"model":"ConvMLP-S","metrics":{"Number of params":"9M","Top 1 Accuracy":"76.8"},"uses_additional_data":false,"paper_date":"2021-09-09","paper":"/paper/convmlp-hierarchical-convolutional-mlps-for","paper_url":"https://arxiv.org/abs/2109.04454v2","paper_title":"ConvMLP: Hierarchical Convolutional MLPs for Vision","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":900,"model":"Perona Malik (Perona and Malik, 1990)","metrics":{"Top 1 Accuracy":"76.71%"},"uses_additional_data":false,"paper_date":"2020-11-03","paper":"/paper/learning-visual-representations-for-transfer-1","paper_url":"https://arxiv.org/abs/2011.01901v3","paper_title":"Learning Visual Representations for Transfer Learning by Suppressing Texture","code":"https://github.com/HaohanWang/ImageNet-Sketch","n_code_links":1,"syntology":null},{"rank_in_archive_order":901,"model":"PVT-T (+MixPro)","metrics":{"Top 1 Accuracy":"76.7%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":902,"model":"MobileViTv3-XS","metrics":{"GFLOPs":"0.927","Number of params":"2.5M","Top 1 Accuracy":"76.7%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":903,"model":"MnasNet-A3","metrics":{"GFLOPs":"0.806","Number of params":"5.2M","Operations per network pass":"0.0403G","Top 1 Accuracy":"76.7%"},"uses_additional_data":false,"paper_date":"2018-07-31","paper":"/paper/mnasnet-platform-aware-neural-architecture","paper_url":"https://arxiv.org/abs/1807.11626v3","paper_title":"MnasNet: Platform-Aware Neural Architecture Search for Mobile","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":29,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":904,"model":"ViL-Tiny-RPB","metrics":{"GFLOPs":"1.3","Number of params":"6.7M","Top 1 Accuracy":"76.7%"},"uses_additional_data":false,"paper_date":"2021-03-29","paper":"/paper/2103-15358","paper_url":"https://arxiv.org/abs/2103.15358v2","paper_title":"Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding","code":"https://github.com/microsoft/esvit","n_code_links":3,"syntology":{"n_ran":6,"n_unverified":4,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":905,"model":"ConViT-Ti+","metrics":{"GFLOPs":"2","Number of params":"10M","Top 1 Accuracy":"76.7%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":906,"model":"TransBoost-ResNet34","metrics":{"Number of params":"21.8M","Top 1 Accuracy":"76.70%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":907,"model":"LIP-DenseNet-BC-121","metrics":{"Number of params":"8.7M","Top 1 Accuracy":"76.64%"},"uses_additional_data":false,"paper_date":"2019-08-12","paper":"/paper/lip-local-importance-based-pooling","paper_url":"https://arxiv.org/abs/1908.04156v3","paper_title":"LIP: Local Importance-based Pooling","code":"https://github.com/sebgao/LIP","n_code_links":1,"syntology":null},{"rank_in_archive_order":908,"model":"ResNet-50 (X-volution, stage3)","metrics":{"Top 1 Accuracy":"76.6%"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/x-volution-on-the-unification-of-convolution","paper_url":"https://arxiv.org/abs/2106.02253v2","paper_title":"X-volution: On the unification of convolution and self-attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":909,"model":"MUXNet-l","metrics":{"GFLOPs":"0.636","Number of params":"4.0M","Top 1 Accuracy":"76.6%"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":910,"model":"DeiT-B","metrics":{"Number of params":"5M","Top 1 Accuracy":"76.6%"},"uses_additional_data":false,"paper_date":"2020-12-23","paper":"/paper/training-data-efficient-image-transformers","paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","code":"https://github.com/huggingface/transformers","n_code_links":40,"syntology":{"n_ran":12,"n_unverified":7,"n_samples":19,"n_pointer_only_licence":3}},{"rank_in_archive_order":911,"model":"MobileViTv3-0.75","metrics":{"GFLOPs":"1.064","Number of params":"3M","Top 1 Accuracy":"76.55%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":912,"model":"Mixer-B/16","metrics":{"Number of params":"46M","Top 1 Accuracy":"76.44%"},"uses_additional_data":false,"paper_date":"2021-05-04","paper":"/paper/mlp-mixer-an-all-mlp-architecture-for-vision","paper_url":"https://arxiv.org/abs/2105.01601v4","paper_title":"MLP-Mixer: An all-MLP Architecture for Vision","code":"https://github.com/labmlai/annotated_deep_learning_paper_implementations","n_code_links":49,"syntology":{"n_ran":106,"n_unverified":28,"n_samples":134,"n_pointer_only_licence":36}},{"rank_in_archive_order":913,"model":"Perceiver","metrics":{"Top 1 Accuracy":"76.4%"},"uses_additional_data":false,"paper_date":"2021-03-04","paper":"/paper/perceiver-general-perception-with-iterative","paper_url":"https://arxiv.org/abs/2103.03206v2","paper_title":"Perceiver: General Perception with Iterative Attention","code":"https://github.com/deepmind/deepmind-research/tree/master/perceiver","n_code_links":12,"syntology":{"n_ran":41,"n_unverified":14,"n_samples":55,"n_pointer_only_licence":11}},{"rank_in_archive_order":914,"model":"CeiT-T","metrics":{"GFLOPs":"1.2","Number of params":"6.4M","Top 1 Accuracy":"76.4%"},"uses_additional_data":false,"paper_date":"2021-03-22","paper":"/paper/incorporating-convolution-designs-into-visual","paper_url":"https://arxiv.org/abs/2103.11816v2","paper_title":"Incorporating Convolution Designs into Visual Transformers","code":"https://github.com/rishikksh20/CeiT-pytorch","n_code_links":3,"syntology":{"n_ran":9,"n_unverified":2,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":915,"model":"ResNet-34 (SAMix)","metrics":{"Number of params":"21.8M","Top 1 Accuracy":"76.35%"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":916,"model":"VGG","metrics":{"Top 1 Accuracy":"76.3","Top 5 Accuracy":"93.2"},"uses_additional_data":true,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":917,"model":"EfficientNet-B0","metrics":{"GFLOPs":"0.39","Number of params":"5.3M","Top 1 Accuracy":"76.3%"},"uses_additional_data":false,"paper_date":"2019-05-28","paper":"/paper/efficientnet-rethinking-model-scaling-for","paper_url":"https://arxiv.org/abs/1905.11946v5","paper_title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","code":"https://github.com/ultralytics/yolov5","n_code_links":144,"syntology":{"n_ran":171,"n_unverified":131,"n_samples":302,"n_pointer_only_licence":112}},{"rank_in_archive_order":918,"model":"RegNetY-800MF","metrics":{"GFLOPs":"0.8","Number of params":"6.3M","Top 1 Accuracy":"76.3%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":919,"model":"SCARLET-B","metrics":{"GFLOPs":"0.658","Number of params":"6.5M","Top 1 Accuracy":"76.3%"},"uses_additional_data":false,"paper_date":"2019-08-16","paper":"/paper/scarletnas-bridging-the-gap-between","paper_url":"https://arxiv.org/abs/1908.06022v6","paper_title":"SCARLET-NAS: Bridging the Gap between Stability and Scalability in Weight-sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/SCARLET-NAS","n_code_links":1,"syntology":null},{"rank_in_archive_order":920,"model":"GLiT-Tinys","metrics":{"GFLOPs":"1.4","Number of params":"7.2M","Top 1 Accuracy":"76.3%"},"uses_additional_data":false,"paper_date":"2021-07-07","paper":"/paper/glit-neural-architecture-search-for-global","paper_url":"https://arxiv.org/abs/2107.02960v3","paper_title":"GLiT: Neural Architecture Search for Global and Local Image Transformer","code":"https://github.com/lpxtt/simtrack","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":921,"model":"DenseNet-169","metrics":{"Top 1 Accuracy":"76.2%"},"uses_additional_data":false,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":18,"n_unverified":53,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":922,"model":"GreedyNAS-C","metrics":{"GFLOPs":"0.284","Number of params":"4.7M","Top 1 Accuracy":"76.2%"},"uses_additional_data":false,"paper_date":"2020-03-25","paper":"/paper/greedynas-towards-fast-one-shot-nas-with","paper_url":"https://arxiv.org/abs/2003.11236v1","paper_title":"GreedyNAS: Towards Fast One-Shot NAS with Greedy Supernet","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":923,"model":"SkipblockNet-M","metrics":{"GFLOPs":"0.246","Number of params":"5.5M","Top 1 Accuracy":"76.2%"},"uses_additional_data":false,"paper_date":"2021-07-23","paper":"/paper/bias-loss-for-mobile-neural-networks","paper_url":"https://arxiv.org/abs/2107.11170v3","paper_title":"Bias Loss for Mobile Neural Networks","code":"https://github.com/lusinlu/biasloss_skipblocknet","n_code_links":2,"syntology":null},{"rank_in_archive_order":924,"model":"ELP (naive ResNet50)","metrics":{"Top 1 Accuracy":"76.13"},"uses_additional_data":false,"paper_date":"2022-01-01","paper":"/paper/a-simple-episodic-linear-probe-improves","paper_url":"http://openaccess.thecvf.com//content/CVPR2022/html/Liang_A_Simple_Episodic_Linear_Probe_Improves_Visual_Recognition_in_the_CVPR_2022_paper.html","paper_title":"A Simple Episodic Linear Probe Improves Visual Recognition in the Wild","code":"https://github.com/JDAI-CV/DCL","n_code_links":2,"syntology":null},{"rank_in_archive_order":925,"model":"ResNet-34 (AutoMix)","metrics":{"Number of params":"21.8M","Top 1 Accuracy":"76.1%"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":926,"model":"ResNet-50 MLPerf v0.7 - 2512 steps","metrics":{"Top 1 Accuracy":"75.92%"},"uses_additional_data":false,"paper_date":"2021-02-12","paper":"/paper/a-large-batch-optimizer-reality-check","paper_url":"https://arxiv.org/abs/2102.06356v3","paper_title":"A Large Batch Optimizer Reality Check: Traditional, Generic Optimizers Suffice Across Batch Sizes","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":927,"model":"DenseNAS-A","metrics":{"Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2019-06-23","paper":"/paper/densely-connected-search-space-for-more","paper_url":"https://arxiv.org/abs/1906.09607v3","paper_title":"Densely Connected Search Space for More Flexible Neural Architecture Search","code":"https://github.com/JaminFong/DenseNAS","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":928,"model":"MobileOne-S1","metrics":{"GFLOPs":"0.825","Number of params":"4.8M","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":929,"model":"MoGA-A","metrics":{"GFLOPs":"0.608","Number of params":"5.1M","Operations per network pass":"0.0304G","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2019-08-04","paper":"/paper/moga-searching-beyond-mobilenetv3","paper_url":"https://arxiv.org/abs/1908.01314v4","paper_title":"MoGA: Searching Beyond MobileNetV3","code":"https://github.com/xiaomi-automl/MoGA","n_code_links":2,"syntology":null},{"rank_in_archive_order":930,"model":"RevBiFPN-S1","metrics":{"GFLOPs":"0.62","Number of params":"5.11M","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":931,"model":"LocalViT-TNT","metrics":{"GFLOPs":"1.4","Number of params":"6.3M","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/localvit-bringing-locality-to-vision","paper_url":"https://arxiv.org/abs/2104.05707v1","paper_title":"LocalViT: Bringing Locality to Vision Transformers","code":"https://github.com/ofsoundof/LocalViT","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":932,"model":"SALG-ST","metrics":{"Number of params":"6.5M","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2022-11-27","paper":"/paper/semantic-aware-local-global-vision","paper_url":"https://arxiv.org/abs/2211.14705v1","paper_title":"Semantic-Aware Local-Global Vision Transformer","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":933,"model":"RedNet-26","metrics":{"GFLOPs":"1.7","Number of params":"9.2M","Top 1 Accuracy":"75.9%"},"uses_additional_data":false,"paper_date":"2021-03-10","paper":"/paper/involution-inverting-the-inherence-of","paper_url":"https://arxiv.org/abs/2103.06255v2","paper_title":"Involution: Inverting the Inherence of Convolution for Visual Recognition","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":13,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":4}},{"rank_in_archive_order":934,"model":"FractalNet-34","metrics":{"Top 1 Accuracy":"75.88%"},"uses_additional_data":false,"paper_date":"2016-05-24","paper":"/paper/fractalnet-ultra-deep-neural-networks-without","paper_url":"http://arxiv.org/abs/1605.07648v4","paper_title":"FractalNet: Ultra-Deep Neural Networks without Residuals","code":"https://github.com/osmr/imgclsmob","n_code_links":4,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":935,"model":"MixNet-S","metrics":{"GFLOPs":"0.256","Number of params":"4.1M","Top 1 Accuracy":"75.8%"},"uses_additional_data":false,"paper_date":"2019-07-22","paper":"/paper/mixnet-mixed-depthwise-convolutional-kernels","paper_url":"https://arxiv.org/abs/1907.09595v3","paper_title":"MixConv: Mixed Depthwise Convolutional Kernels","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":2,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":936,"model":"CoordConv ResNet-50","metrics":{"Top 1 Accuracy":"75.74%"},"uses_additional_data":false,"paper_date":"2018-07-09","paper":"/paper/an-intriguing-failing-of-convolutional-neural","paper_url":"http://arxiv.org/abs/1807.03247v2","paper_title":"An Intriguing Failing of Convolutional Neural Networks and the CoordConv Solution","code":"https://github.com/mkocabas/CoordConv-pytorch","n_code_links":24,"syntology":{"n_ran":4,"n_unverified":1,"n_samples":5,"n_pointer_only_licence":0}},{"rank_in_archive_order":937,"model":"LeViT-128S","metrics":{"GFLOPs":"0.288","Number of params":"4.7M","Top 1 Accuracy":"75.7%"},"uses_additional_data":false,"paper_date":"2021-04-02","paper":"/paper/levit-a-vision-transformer-in-convnet-s","paper_url":"https://arxiv.org/abs/2104.01136v2","paper_title":"LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference","code":"https://github.com/huggingface/transformers","n_code_links":12,"syntology":{"n_ran":23,"n_unverified":7,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":938,"model":"GhostNet ×1.3","metrics":{"GFLOPs":"0.226","Number of params":"7.3M","Top 1 Accuracy":"75.7%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/ghostnet-more-features-from-cheap-operations","paper_url":"https://arxiv.org/abs/1911.11907v2","paper_title":"GhostNet: More Features from Cheap Operations","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":33,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":4}},{"rank_in_archive_order":939,"model":"LR-Net-26","metrics":{"GFLOPs":"2.6","Number of params":"14.7M","Top 1 Accuracy":"75.7%"},"uses_additional_data":false,"paper_date":"2019-04-25","paper":"/paper/190411491","paper_url":"http://arxiv.org/abs/1904.11491v1","paper_title":"Local Relation Networks for Image Recognition","code":"https://github.com/microsoft/Swin-Transformer","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":940,"model":"Mixer-S16 + STD","metrics":{"GFLOPs":"4.3","Number of params":"22.2M","Top 1 Accuracy":"75.7%"},"uses_additional_data":false,"paper_date":"2022-07-23","paper":"/paper/spatial-channel-token-distillation-for-vision","paper_url":"https://proceedings.mlr.press/v162/li22c.html","paper_title":"Spatial-Channel Token Distillation for Vision MLPs","code":"https://github.com/devrimcavusoglu/std","n_code_links":1,"syntology":null},{"rank_in_archive_order":941,"model":"SimpleNetV1-small-075-correct-labels","metrics":{"Number of params":"3M","Top 1 Accuracy":"75.66"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":942,"model":"FastViT-T8","metrics":{"Top 1 Accuracy":"75.6%"},"uses_additional_data":false,"paper_date":"2023-03-24","paper":"/paper/fastvit-a-fast-hybrid-vision-transformer","paper_url":"https://arxiv.org/abs/2303.14189v2","paper_title":"FastViT: A Fast Hybrid Vision Transformer using Structural Reparameterization","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":6,"syntology":{"n_ran":1,"n_unverified":4,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":943,"model":"MobileViTv2-0.75","metrics":{"GFLOPs":"1.0","Number of params":"2.9M","Top 1 Accuracy":"75.6%"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/separable-self-attention-for-mobile-vision","paper_url":"https://arxiv.org/abs/2206.02680v1","paper_title":"Separable Self-attention for Mobile Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":944,"model":"MnasNet-A2","metrics":{"GFLOPs":"0.680","Number of params":"4.8M","Top 1 Accuracy":"75.6%"},"uses_additional_data":false,"paper_date":"2018-07-31","paper":"/paper/mnasnet-platform-aware-neural-architecture","paper_url":"https://arxiv.org/abs/1807.11626v3","paper_title":"MnasNet: Platform-Aware Neural Architecture Search for Mobile","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":29,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":945,"model":"SCARLET-C","metrics":{"GFLOPs":"0.560","Number of params":"6M","Top 1 Accuracy":"75.6%"},"uses_additional_data":false,"paper_date":"2019-08-16","paper":"/paper/scarletnas-bridging-the-gap-between","paper_url":"https://arxiv.org/abs/1908.06022v6","paper_title":"SCARLET-NAS: Bridging the Gap between Stability and Scalability in Weight-sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/SCARLET-NAS","n_code_links":1,"syntology":null},{"rank_in_archive_order":946,"model":"PAWS (ResNet-50, 10% labels)","metrics":{"Top 1 Accuracy":"75.5%"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/semi-supervised-learning-of-visual-features","paper_url":"https://arxiv.org/abs/2104.13963v3","paper_title":"Semi-Supervised Learning of Visual Features by Non-Parametrically Predicting View Assignments with Support Samples","code":"https://github.com/facebookresearch/suncet","n_code_links":4,"syntology":{"n_ran":7,"n_unverified":14,"n_samples":21,"n_pointer_only_licence":3}},{"rank_in_archive_order":947,"model":"RegNetY-600MF","metrics":{"GFLOPs":"0.6","Number of params":"6.1M","Top 1 Accuracy":"75.5%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":948,"model":"ShuffleNet V2","metrics":{"GFLOPs":"0.597","Top 1 Accuracy":"75.4%"},"uses_additional_data":false,"paper_date":"2018-07-30","paper":"/paper/shufflenet-v2-practical-guidelines-for","paper_url":"http://arxiv.org/abs/1807.11164v1","paper_title":"ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture Design","code":"https://github.com/pytorch/vision","n_code_links":35,"syntology":{"n_ran":1,"n_unverified":29,"n_samples":30,"n_pointer_only_licence":0}},{"rank_in_archive_order":949,"model":"VAN-B0","metrics":{"GFLOPs":"0.9","Number of params":"4.1M","Top 1 Accuracy":"75.4%"},"uses_additional_data":false,"paper_date":"2022-02-20","paper":"/paper/visual-attention-network","paper_url":"https://arxiv.org/abs/2202.09741v5","paper_title":"Visual Attention Network","code":"https://github.com/huggingface/transformers","n_code_links":21,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":950,"model":"AsymmNet-Large ×1.0","metrics":{"GFLOPs":"0.4338","Number of params":"5.99M","Top 1 Accuracy":"75.4%"},"uses_additional_data":false,"paper_date":"2021-04-15","paper":"/paper/asymmnet-towards-ultralight-convolution","paper_url":"https://arxiv.org/abs/2104.07770v1","paper_title":"AsymmNet: Towards ultralight convolution neural networks using asymmetrical bottlenecks","code":"https://github.com/Spark001/AsymmNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":951,"model":"FairNAS-A","metrics":{"GFLOPs":"0.776","Number of params":"4.6M","Top 1 Accuracy":"75.34%"},"uses_additional_data":false,"paper_date":"2019-07-03","paper":"/paper/fairnas-rethinking-evaluation-fairness-of","paper_url":"https://arxiv.org/abs/1907.01845v5","paper_title":"FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/FairNAS","n_code_links":2,"syntology":null},{"rank_in_archive_order":952,"model":"ViTAE-T","metrics":{"GFLOPs":"3.0","Top 1 Accuracy":"75.3%"},"uses_additional_data":false,"paper_date":"2021-06-07","paper":"/paper/vitae-vision-transformer-advanced-by","paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","code":"https://github.com/ViTAE-Transformer/ViTAE-Transformer","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":0,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":953,"model":"MUXNet-m","metrics":{"GFLOPs":"0.436","Number of params":"3.4M","Top 1 Accuracy":"75.3%"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":954,"model":"ResNet-50","metrics":{"GFLOPs":"3.8","Number of params":"25M","Top 1 Accuracy":"75.3%"},"uses_additional_data":false,"paper_date":"2015-12-10","paper":"/paper/deep-residual-learning-for-image-recognition","paper_url":"http://arxiv.org/abs/1512.03385v1","paper_title":"Deep Residual Learning for Image Recognition","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":484,"syntology":{"n_ran":230,"n_unverified":147,"n_samples":377,"n_pointer_only_licence":187}},{"rank_in_archive_order":955,"model":"MnasNet-A1","metrics":{"GFLOPs":"0.624","Number of params":"3.9M","Top 1 Accuracy":"75.2%"},"uses_additional_data":false,"paper_date":"2018-07-31","paper":"/paper/mnasnet-platform-aware-neural-architecture","paper_url":"https://arxiv.org/abs/1807.11626v3","paper_title":"MnasNet: Platform-Aware Neural Architecture Search for Mobile","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":29,"syntology":{"n_ran":2,"n_unverified":4,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":956,"model":"MobileNet V3-Large 1.0","metrics":{"GFLOPs":"0.438","Number of params":"5.4M","Top 1 Accuracy":"75.2%"},"uses_additional_data":false,"paper_date":"2019-05-06","paper":"/paper/searching-for-mobilenetv3","paper_url":"https://arxiv.org/abs/1905.02244v5","paper_title":"Searching for MobileNetV3","code":"https://github.com/tensorflow/models","n_code_links":67,"syntology":{"n_ran":58,"n_unverified":47,"n_samples":105,"n_pointer_only_licence":46}},{"rank_in_archive_order":957,"model":"DiCENet","metrics":{"GFLOPs":"0.553","Top 1 Accuracy":"75.1%"},"uses_additional_data":false,"paper_date":"2019-06-08","paper":"/paper/dicenet-dimension-wise-convolutions-for","paper_url":"https://arxiv.org/abs/1906.03516v3","paper_title":"DiCENet: Dimension-wise Convolutions for Efficient Networks","code":"https://github.com/osmr/imgclsmob","n_code_links":2,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":958,"model":"MultiGrain NASNet-A-Mobile (350px)","metrics":{"Top 1 Accuracy":"75.1%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/multigrain-a-unified-image-embedding-for","paper_url":"http://arxiv.org/abs/1902.05509v2","paper_title":"MultiGrain: a unified image embedding for classes and instances","code":"https://github.com/facebookresearch/multigrain","n_code_links":3,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":959,"model":"FairNAS-B","metrics":{"GFLOPs":"0.690","Number of params":"4.5M","Top 1 Accuracy":"75.10%"},"uses_additional_data":false,"paper_date":"2019-07-03","paper":"/paper/fairnas-rethinking-evaluation-fairness-of","paper_url":"https://arxiv.org/abs/1907.01845v5","paper_title":"FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/FairNAS","n_code_links":2,"syntology":null},{"rank_in_archive_order":960,"model":"ResNet-34 (X-volution, stage3)","metrics":{"Top 1 Accuracy":"75%"},"uses_additional_data":false,"paper_date":"2021-06-04","paper":"/paper/x-volution-on-the-unification-of-convolution","paper_url":"https://arxiv.org/abs/2106.02253v2","paper_title":"X-volution: On the unification of convolution and self-attention","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":961,"model":"Ghost-ResNet-50 (s=2)","metrics":{"GFLOPs":"2.2","Number of params":"13M","Top 1 Accuracy":"75%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/ghostnet-more-features-from-cheap-operations","paper_url":"https://arxiv.org/abs/1911.11907v2","paper_title":"GhostNet: More Features from Cheap Operations","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":33,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":4}},{"rank_in_archive_order":962,"model":"DenseNet-121","metrics":{"Top 1 Accuracy":"74.98%"},"uses_additional_data":false,"paper_date":"2016-08-25","paper":"/paper/densely-connected-convolutional-networks","paper_url":"http://arxiv.org/abs/1608.06993v5","paper_title":"Densely Connected Convolutional Networks","code":"https://github.com/pytorch/vision","n_code_links":146,"syntology":{"n_ran":18,"n_unverified":53,"n_samples":71,"n_pointer_only_licence":7}},{"rank_in_archive_order":963,"model":"Single-Path NAS","metrics":{"Top 1 Accuracy":"74.96%"},"uses_additional_data":false,"paper_date":"2019-04-05","paper":"/paper/single-path-nas-designing-hardware-efficient","paper_url":"http://arxiv.org/abs/1904.02877v1","paper_title":"Single-Path NAS: Designing Hardware-Efficient ConvNets in less than 4 Hours","code":"https://github.com/osmr/imgclsmob","n_code_links":9,"syntology":{"n_ran":1,"n_unverified":15,"n_samples":16,"n_pointer_only_licence":0}},{"rank_in_archive_order":964,"model":"WaveMix-192/16 (level 3)","metrics":{"Top 1 Accuracy":"74.93%"},"uses_additional_data":false,"paper_date":"2022-05-28","paper":"/paper/wavemix-lite-a-resource-efficient-neural","paper_url":"https://arxiv.org/abs/2205.14375v5","paper_title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":965,"model":"FF","metrics":{"Top 1 Accuracy":"74.9"},"uses_additional_data":false,"paper_date":"2021-05-06","paper":"/paper/do-you-even-need-attention-a-stack-of-feed","paper_url":"https://arxiv.org/abs/2105.02723v1","paper_title":"Do You Even Need Attention? A Stack of Feed-Forward Layers Does Surprisingly Well on ImageNet","code":"https://github.com/BR-IDL/PaddleViT/tree/develop/image_classification/FF_Only","n_code_links":2,"syntology":null},{"rank_in_archive_order":966,"model":"FBNet-C","metrics":{"GFLOPs":"0.375","Number of params":"5.5M","Top 1 Accuracy":"74.9%"},"uses_additional_data":false,"paper_date":"2018-12-09","paper":"/paper/fbnet-hardware-aware-efficient-convnet-design","paper_url":"https://arxiv.org/abs/1812.03443v3","paper_title":"FBNet: Hardware-Aware Efficient ConvNet Design via Differentiable Neural Architecture Search","code":"https://github.com/facebookresearch/mobile-vision","n_code_links":5,"syntology":{"n_ran":0,"n_unverified":1,"n_samples":1,"n_pointer_only_licence":0}},{"rank_in_archive_order":967,"model":"ESPNetv2","metrics":{"GFLOPs":"0.602","Number of params":"5.9M","Top 1 Accuracy":"74.9%"},"uses_additional_data":false,"paper_date":"2018-11-28","paper":"/paper/espnetv2-a-light-weight-power-efficient-and","paper_url":"http://arxiv.org/abs/1811.11431v3","paper_title":"ESPNetv2: A Light-weight, Power Efficient, and General Purpose Convolutional Neural Network","code":"https://github.com/PaddlePaddle/PaddleSeg","n_code_links":10,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":968,"model":"MobileViT-XS","metrics":{"GFLOPs":"0.7","Number of params":"2.3M","Top 1 Accuracy":"74.8%"},"uses_additional_data":false,"paper_date":"2021-10-05","paper":"/paper/mobilevit-light-weight-general-purpose-and","paper_url":"https://arxiv.org/abs/2110.02178v2","paper_title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":31,"syntology":{"n_ran":53,"n_unverified":15,"n_samples":68,"n_pointer_only_licence":18}},{"rank_in_archive_order":969,"model":"LocalViT-T","metrics":{"GFLOPs":"1.3","Number of params":"5.9M","Top 1 Accuracy":"74.8%"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/localvit-bringing-locality-to-vision","paper_url":"https://arxiv.org/abs/2104.05707v1","paper_title":"LocalViT: Bringing Locality to Vision Transformers","code":"https://github.com/ofsoundof/LocalViT","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":970,"model":"RandWire-WS (small)","metrics":{"GFLOPs":"0.583","Number of params":"5.6M","Top 1 Accuracy":"74.7%"},"uses_additional_data":false,"paper_date":"2019-04-02","paper":"/paper/exploring-randomly-wired-neural-networks-for","paper_url":"http://arxiv.org/abs/1904.01569v2","paper_title":"Exploring Randomly Wired Neural Networks for Image Recognition","code":"https://github.com/facebookresearch/pycls","n_code_links":9,"syntology":{"n_ran":0,"n_unverified":31,"n_samples":31,"n_pointer_only_licence":0}},{"rank_in_archive_order":971,"model":"AutoFormer-tiny","metrics":{"GFLOPs":"1.3","Number of params":"5.7M","Top 1 Accuracy":"74.7%"},"uses_additional_data":false,"paper_date":"2021-07-01","paper":"/paper/autoformer-searching-transformers-for-visual","paper_url":"https://arxiv.org/abs/2107.00651v1","paper_title":"AutoFormer: Searching Transformers for Visual Recognition","code":"https://github.com/microsoft/AutoML","n_code_links":2,"syntology":null},{"rank_in_archive_order":972,"model":"MobileNetV2 (1.4)","metrics":{"GFLOPs":"1.170","Number of params":"6.9M","Top 1 Accuracy":"74.7%"},"uses_additional_data":false,"paper_date":"2018-01-13","paper":"/paper/mobilenetv2-inverted-residuals-and-linear","paper_url":"http://arxiv.org/abs/1801.04381v4","paper_title":"MobileNetV2: Inverted Residuals and Linear Bottlenecks","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":159,"syntology":{"n_ran":85,"n_unverified":26,"n_samples":111,"n_pointer_only_licence":64}},{"rank_in_archive_order":973,"model":"FairNAS-C","metrics":{"GFLOPs":"0.642","Number of params":"4.4M","Top 1 Accuracy":"74.69%"},"uses_additional_data":false,"paper_date":"2019-07-03","paper":"/paper/fairnas-rethinking-evaluation-fairness-of","paper_url":"https://arxiv.org/abs/1907.01845v5","paper_title":"FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture Search","code":"https://github.com/xiaomi-automl/FairNAS","n_code_links":2,"syntology":null},{"rank_in_archive_order":974,"model":"ReXNet_0.6","metrics":{"Number of params":"2.7M","Top 1 Accuracy":"74.6%"},"uses_additional_data":false,"paper_date":"2020-07-02","paper":"/paper/rexnet-diminishing-representational","paper_url":"https://arxiv.org/abs/2007.00992v3","paper_title":"Rethinking Channel Dimensions for Efficient Model Design","code":"https://github.com/PaddlePaddle/PaddleClas","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":975,"model":"Proxyless","metrics":{"Number of params":"4.0M","Top 1 Accuracy":"74.6%"},"uses_additional_data":false,"paper_date":"2018-12-02","paper":"/paper/proxylessnas-direct-neural-architecture","paper_url":"http://arxiv.org/abs/1812.00332v2","paper_title":"ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware","code":"https://github.com/osmr/imgclsmob","n_code_links":23,"syntology":{"n_ran":5,"n_unverified":22,"n_samples":27,"n_pointer_only_licence":0}},{"rank_in_archive_order":976,"model":"PiT-Ti","metrics":{"GFLOPs":"0.7","Number of params":"4.9M","Top 1 Accuracy":"74.6%"},"uses_additional_data":false,"paper_date":"2021-03-30","paper":"/paper/rethinking-spatial-dimensions-of-vision","paper_url":"https://arxiv.org/abs/2103.16302v2","paper_title":"Rethinking Spatial Dimensions of Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":12,"syntology":{"n_ran":10,"n_unverified":10,"n_samples":20,"n_pointer_only_licence":0}},{"rank_in_archive_order":977,"model":"DY-MobileNetV2 ×1.0","metrics":{"GFLOPs":"0,626","Number of params":"11.1M","Top 1 Accuracy":"74.4%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":978,"model":"SimpleNetV1-9m","metrics":{"Number of params":"9.5M","Top 1 Accuracy":"74.17"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":979,"model":"RegNetY-400MF","metrics":{"GFLOPs":"0.4","Number of params":"4.3M","Top 1 Accuracy":"74.1%"},"uses_additional_data":false,"paper_date":"2020-03-30","paper":"/paper/designing-network-design-spaces","paper_url":"https://arxiv.org/abs/2003.13678v1","paper_title":"Designing Network Design Spaces","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":26,"syntology":{"n_ran":11,"n_unverified":42,"n_samples":53,"n_pointer_only_licence":0}},{"rank_in_archive_order":980,"model":"Ghost-ResNet-50 (s=4)","metrics":{"GFLOPs":"1.2","Number of params":"6.5M","Top 1 Accuracy":"74.1%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/ghostnet-more-features-from-cheap-operations","paper_url":"https://arxiv.org/abs/1911.11907v2","paper_title":"GhostNet: More Features from Cheap Operations","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":33,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":4}},{"rank_in_archive_order":981,"model":"SReT-ExT","metrics":{"GFLOPs":"0.7","Number of params":"4M","Top 1 Accuracy":"74.0%"},"uses_additional_data":false,"paper_date":"2021-11-09","paper":"/paper/sliced-recursive-transformer-1","paper_url":"https://arxiv.org/abs/2111.05297v3","paper_title":"Sliced Recursive Transformer","code":"https://github.com/szq0214/sret","n_code_links":1,"syntology":null},{"rank_in_archive_order":982,"model":"GhostNet ×1.0","metrics":{"GFLOPs":"0.141","Number of params":"5.2M","Top 1 Accuracy":"73.9%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/ghostnet-more-features-from-cheap-operations","paper_url":"https://arxiv.org/abs/1911.11907v2","paper_title":"GhostNet: More Features from Cheap Operations","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":33,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":4}},{"rank_in_archive_order":983,"model":"DeiT-T (+MixPro)","metrics":{"Top 1 Accuracy":"73.8%"},"uses_additional_data":false,"paper_date":"2023-04-24","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","paper_url":"https://arxiv.org/abs/2304.12043v2","paper_title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","code":"https://github.com/fistyee/mixpro","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":8,"n_samples":18,"n_pointer_only_licence":0}},{"rank_in_archive_order":984,"model":"MNv4-Conv-S","metrics":{"Top 1 Accuracy":"73.8%"},"uses_additional_data":false,"paper_date":"2024-04-16","paper":"/paper/mobilenetv4-universal-models-for-the-mobile","paper_url":"https://arxiv.org/abs/2404.10518v2","paper_title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","code":"https://github.com/tensorflow/models/blob/master/official/vision/modeling/backbones/mobilenet.py","n_code_links":7,"syntology":{"n_ran":6,"n_unverified":7,"n_samples":13,"n_pointer_only_licence":1}},{"rank_in_archive_order":985,"model":"DeiT-Ti with iRPE-K","metrics":{"GFLOPs":"2.568","Number of params":"6M","Top 1 Accuracy":"73.7%"},"uses_additional_data":false,"paper_date":"2021-07-29","paper":"/paper/rethinking-and-improving-relative-position","paper_url":"https://arxiv.org/abs/2107.14222v1","paper_title":"Rethinking and Improving Relative Position Encoding for Vision Transformer","code":"https://github.com/microsoft/cream","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":2,"n_samples":9,"n_pointer_only_licence":0}},{"rank_in_archive_order":986,"model":"DGPPF-ResNet50","metrics":{"GFLOPs":"0.4","Number of params":"2.56M","Top 1 Accuracy":"73.66%"},"uses_additional_data":false,"paper_date":"2024-02-15","paper":"/paper/distilled-gradual-pruning-with-pruned-fine","paper_url":"https://ieeexplore.ieee.org/document/10438214","paper_title":"Distilled Gradual Pruning with Pruned Fine-tuning","code":"https://github.com/rom42pla/dg2pf","n_code_links":1,"syntology":null},{"rank_in_archive_order":987,"model":"TransBoost-ResNet18","metrics":{"Number of params":"11.69M","Top 1 Accuracy":"73.36%"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/transboost-improving-the-best-imagenet","paper_url":"https://arxiv.org/abs/2205.13331v4","paper_title":"TransBoost: Improving the Best ImageNet Performance using Deep Transduction","code":"https://github.com/omerb01/transboost","n_code_links":1,"syntology":null},{"rank_in_archive_order":988,"model":"Wide ResNet-50 (edge-popup)","metrics":{"Number of params":"20.6M","Top 1 Accuracy":"73.3%"},"uses_additional_data":false,"paper_date":"2019-11-29","paper":"/paper/whats-hidden-in-a-randomly-weighted-neural","paper_url":"https://arxiv.org/abs/1911.13299v2","paper_title":"What's Hidden in a Randomly Weighted Neural Network?","code":"https://github.com/allenai/hidden-networks","n_code_links":4,"syntology":{"n_ran":2,"n_unverified":7,"n_samples":9,"n_pointer_only_licence":1}},{"rank_in_archive_order":989,"model":"ResNet-18 (MEAL V2)","metrics":{"Top 1 Accuracy":"73.19%"},"uses_additional_data":false,"paper_date":"2020-09-17","paper":"/paper/meal-v2-boosting-vanilla-resnet-50-to-80-top","paper_url":"https://arxiv.org/abs/2009.08453v2","paper_title":"MEAL V2: Boosting Vanilla ResNet-50 to 80%+ Top-1 Accuracy on ImageNet without Tricks","code":"https://github.com/szq0214/MEAL-V2","n_code_links":1,"syntology":null},{"rank_in_archive_order":990,"model":"ConViT-Ti","metrics":{"GFLOPs":"1","Number of params":"6M","Top 1 Accuracy":"73.1%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/convit-improving-vision-transformers-with","paper_url":"https://arxiv.org/abs/2103.10697v2","paper_title":"ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":9,"syntology":null},{"rank_in_archive_order":991,"model":"RevBiFPN-S0","metrics":{"GFLOPs":"0.31","Number of params":"3.42M","Top 1 Accuracy":"72.8%"},"uses_additional_data":false,"paper_date":"2022-06-28","paper":"/paper/revbifpn-the-fully-reversible-bidirectional","paper_url":"https://arxiv.org/abs/2206.14098v2","paper_title":"RevBiFPN: The Fully Reversible Bidirectional Feature Pyramid Network","code":"https://github.com/cerebrasresearch/revbifpn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":992,"model":"DY-MobileNetV2 ×0.75","metrics":{"GFLOPs":"0.435","Number of params":"7M","Top 1 Accuracy":"72.8%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":993,"model":"DY-ResNet-18","metrics":{"GFLOPs":"3.7","Number of params":"42.7M","Top 1 Accuracy":"72.7%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":994,"model":"ECA-Net (MobileNetV2)","metrics":{"GFLOPs":"0.320","Number of params":"3.34M","Top 1 Accuracy":"72.56%"},"uses_additional_data":false,"paper_date":"2019-10-08","paper":"/paper/eca-net-efficient-channel-attention-for-deep","paper_url":"https://arxiv.org/abs/1910.03151v4","paper_title":"ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":13,"syntology":{"n_ran":1,"n_unverified":7,"n_samples":8,"n_pointer_only_licence":0}},{"rank_in_archive_order":995,"model":"MobileNet-224 (CGD)","metrics":{"GFLOPs":"1.198","Number of params":"4.26M","Top 1 Accuracy":"72.56%"},"uses_additional_data":false,"paper_date":"2019-07-23","paper":"/paper/compact-global-descriptor-for-neural-networks","paper_url":"https://arxiv.org/abs/1907.09665v10","paper_title":"Compact Global Descriptor for Neural Networks","code":"https://github.com/HolmesShuan/Compact-Global-Descriptor","n_code_links":1,"syntology":null},{"rank_in_archive_order":996,"model":"MobileOne-S0 (distill)","metrics":{"GFLOPs":"0.275","Number of params":"2.1M","Top 1 Accuracy":"72.5%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":997,"model":"LocalViT-T2T","metrics":{"GFLOPs":"1.2","Number of params":"4.3M","Top 1 Accuracy":"72.5%"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/localvit-bringing-locality-to-vision","paper_url":"https://arxiv.org/abs/2104.05707v1","paper_title":"LocalViT: Bringing Locality to Vision Transformers","code":"https://github.com/ofsoundof/LocalViT","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":998,"model":"MobileViTv3-0.5","metrics":{"GFLOPs":"0.481","Number of params":"1.4M","Top 1 Accuracy":"72.33%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":999,"model":"ResNet-18 (SAMix)","metrics":{"Number of params":"11.7M","Top 1 Accuracy":"72.33%"},"uses_additional_data":false,"paper_date":"2021-11-30","paper":"/paper/boosting-discriminative-visual-representation","paper_url":"https://arxiv.org/abs/2111.15454v3","paper_title":"Boosting Discriminative Visual Representation Learning with Scenario-Agnostic Mixup","code":"https://github.com/Westlake-AI/openmixup","n_code_links":1,"syntology":null},{"rank_in_archive_order":1000,"model":"ResNet-50","metrics":{"Top 1 Accuracy":"72.1%"},"uses_additional_data":false,"paper_date":"2019-10-09","paper":"/paper/on-the-adequacy-of-untuned-warmup-for","paper_url":"https://arxiv.org/abs/1910.04209v3","paper_title":"On the adequacy of untuned warmup for adaptive optimization","code":"https://github.com/Tony-Y/pytorch_warmup","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":4,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1001,"model":"ResNet-18 (AutoMix)","metrics":{"Number of params":"11.7M","Top 1 Accuracy":"72.05%"},"uses_additional_data":false,"paper_date":"2021-03-24","paper":"/paper/automix-unveiling-the-power-of-mixup","paper_url":"https://arxiv.org/abs/2103.13027v6","paper_title":"AutoMix: Unveiling the Power of Mixup for Stronger Classifiers","code":"https://github.com/Westlake-AI/openmixup","n_code_links":3,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":1002,"model":"MobileNetV2","metrics":{"GFLOPs":"0.600","Number of params":"3.4M","Top 1 Accuracy":"72%"},"uses_additional_data":true,"paper_date":"2018-01-13","paper":"/paper/mobilenetv2-inverted-residuals-and-linear","paper_url":"http://arxiv.org/abs/1801.04381v4","paper_title":"MobileNetV2: Inverted Residuals and Linear Bottlenecks","code":"https://github.com/tensorflow/models/tree/master/research/deeplab","n_code_links":159,"syntology":{"n_ran":85,"n_unverified":26,"n_samples":111,"n_pointer_only_licence":64}},{"rank_in_archive_order":1003,"model":"Ours","metrics":{"Top 1 Accuracy":"71.97%"},"uses_additional_data":false,"paper_date":"2020-09-10","paper":"/paper/quantnet-learning-to-quantize-by-learning","paper_url":"https://arxiv.org/abs/2009.04626v1","paper_title":"QuantNet: Learning to Quantize by Learning within Fully Differentiable Framework","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1004,"model":"SimpleNetV1-5m","metrics":{"Number of params":"5.7M","Top 1 Accuracy":"71.94"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":1005,"model":"ResNet-18 (PAD-L2 w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"71.71%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1006,"model":"MUXNet-s","metrics":{"GFLOPs":"0.234","Number of params":"2.4M","Top 1 Accuracy":"71.6%"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":1007,"model":"PDC","metrics":{"Number of params":"11.51M","Top 1 Accuracy":"71.6%"},"uses_additional_data":false,"paper_date":"2021-04-16","paper":"/paper/polynomial-networks-in-deep-classifiers","paper_url":"https://arxiv.org/abs/2104.07916v2","paper_title":"Augmenting Deep Classifiers with Polynomial Neural Networks","code":"https://github.com/grigorisg9gr/polynomials-for-augmenting-nns","n_code_links":2,"syntology":{"n_ran":4,"n_unverified":2,"n_samples":6,"n_pointer_only_licence":6}},{"rank_in_archive_order":1008,"model":"ResNet-18 (FT w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"71.56%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1009,"model":"EfficientFormer-V2-S0","metrics":{"Top 1 Accuracy":"71.53%"},"uses_additional_data":false,"paper_date":"2023-08-18","paper":"/paper/which-transformer-to-favor-a-comparative","paper_url":"https://arxiv.org/abs/2308.09372v3","paper_title":"Which Transformer to Favor: A Comparative Analysis of Efficiency in Vision Transformers","code":"https://github.com/tobna/whattransformertofavor","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":0,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1010,"model":"MobileOne-S0","metrics":{"Number of params":"2.1M","Top 1 Accuracy":"71.4%"},"uses_additional_data":false,"paper_date":"2022-06-08","paper":"/paper/an-improved-one-millisecond-mobile-backbone","paper_url":"https://arxiv.org/abs/2206.04040v2","paper_title":"MobileOne: An Improved One millisecond Mobile Backbone","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":10,"syntology":{"n_ran":1,"n_unverified":5,"n_samples":6,"n_pointer_only_licence":2}},{"rank_in_archive_order":1011,"model":"ResNet-18 (KD w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"71.37%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1012,"model":"Dspike (VGG-16)","metrics":{"Top 1 Accuracy":"71.24"},"uses_additional_data":true,"paper_date":"2021-12-01","paper":"/paper/differentiable-spike-rethinking-gradient","paper_url":"http://proceedings.neurips.cc/paper/2021/hash/c4ca4238a0b923820dcc509a6f75849b-Abstract.html","paper_title":"Differentiable Spike: Rethinking Gradient-Descent for Training Spiking Neural Networks","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1013,"model":"EdgeNeXt-XXS","metrics":{"GFLOPs":"0.522","Number of params":"1.3M","Top 1 Accuracy":"71.2%"},"uses_additional_data":false,"paper_date":"2022-06-21","paper":"/paper/edgenext-efficiently-amalgamated-cnn","paper_url":"https://arxiv.org/abs/2206.10589v3","paper_title":"EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for Mobile Vision Applications","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":9,"n_samples":10,"n_pointer_only_licence":0}},{"rank_in_archive_order":1014,"model":"ResNet-18 (L2 w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"71.08%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1015,"model":"MobileViTv3-XXS","metrics":{"GFLOPs":"0.289","Number of params":"1.2M","Top 1 Accuracy":"70.98%"},"uses_additional_data":false,"paper_date":"2022-09-30","paper":"/paper/mobilevitv3-mobile-friendly-vision","paper_url":"https://arxiv.org/abs/2209.15159v2","paper_title":"MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features","code":"https://github.com/microndla/mobilevitv3","n_code_links":2,"syntology":null},{"rank_in_archive_order":1016,"model":"ResNet-18 (CRD w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"70.93%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1017,"model":"ShuffleNet","metrics":{"Top 1 Accuracy":"70.9%"},"uses_additional_data":false,"paper_date":"2017-07-04","paper":"/paper/shufflenet-an-extremely-efficient","paper_url":"http://arxiv.org/abs/1707.01083v2","paper_title":"ShuffleNet: An Extremely Efficient Convolutional Neural Network for Mobile Devices","code":"https://github.com/open-mmlab/mmpose","n_code_links":38,"syntology":null},{"rank_in_archive_order":1018,"model":"MobileNet-224 ×1.25","metrics":{"GFLOPs":"1.138","Top 1 Accuracy":"70.6%"},"uses_additional_data":false,"paper_date":"2017-04-17","paper":"/paper/mobilenets-efficient-convolutional-neural","paper_url":"http://arxiv.org/abs/1704.04861v1","paper_title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","code":"https://github.com/tensorflow/tensorflow/blob/v2.4.1/tensorflow/python/keras/applications/mobilenet.py","n_code_links":159,"syntology":{"n_ran":52,"n_unverified":31,"n_samples":83,"n_pointer_only_licence":48}},{"rank_in_archive_order":1019,"model":"PSN (SEW ResNet-34)","metrics":{"Top 1 Accuracy":"70.54"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1020,"model":"ResNet-18 (tf-KD w/ ResNet-18 teacher)","metrics":{"Top 1 Accuracy":"70.52%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1021,"model":"PVTv2-B0","metrics":{"GFLOPs":"0.6","Number of params":"3.4M","Top 1 Accuracy":"70.5%"},"uses_additional_data":false,"paper_date":"2021-06-25","paper":"/paper/pvtv2-improved-baselines-with-pyramid-vision","paper_url":"https://arxiv.org/abs/2106.13797v7","paper_title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":18,"syntology":null},{"rank_in_archive_order":1022,"model":"GAC-SNN MS-ResNet-34","metrics":{"Top 1 Accuracy":"70.42"},"uses_additional_data":false,"paper_date":"2023-08-12","paper":"/paper/gated-attention-coding-for-training-high","paper_url":"https://arxiv.org/abs/2308.06582v2","paper_title":"Gated Attention Coding for Training High-performance and Efficient Spiking Neural Networks","code":"https://github.com/bollossom/GAC","n_code_links":1,"syntology":{"n_ran":7,"n_unverified":5,"n_samples":12,"n_pointer_only_licence":12}},{"rank_in_archive_order":1023,"model":"MobileViTv2-0.5","metrics":{"GFLOPs":"0.5","Number of params":"1.4M","Top 1 Accuracy":"70.2%"},"uses_additional_data":false,"paper_date":"2022-06-06","paper":"/paper/separable-self-attention-for-mobile-vision","paper_url":"https://arxiv.org/abs/2206.02680v1","paper_title":"Separable Self-attention for Mobile Vision Transformers","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":8,"syntology":{"n_ran":1,"n_unverified":0,"n_samples":1,"n_pointer_only_licence":1}},{"rank_in_archive_order":1024,"model":"ResNet-18 (SSKD w/ ResNet-34 teacher)","metrics":{"Top 1 Accuracy":"70.09%"},"uses_additional_data":false,"paper_date":"2020-11-25","paper":"/paper/torchdistill-a-modular-configuration-driven","paper_url":"https://arxiv.org/abs/2011.12913v2","paper_title":"torchdistill: A Modular, Configuration-Driven Framework for Knowledge Distillation","code":"https://github.com/yoshitomo-matsubara/torchdistill","n_code_links":1,"syntology":{"n_ran":10,"n_unverified":16,"n_samples":26,"n_pointer_only_licence":0}},{"rank_in_archive_order":1025,"model":"DY-MobileNetV3-Small","metrics":{"GFLOPs":"0.137","Number of params":"4.8M","Top 1 Accuracy":"69.7%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1026,"model":"HVT-Ti-1","metrics":{"GFLOPs":"0.64","Number of params":"5.74M","Top 1 Accuracy":"69.64%"},"uses_additional_data":false,"paper_date":"2021-03-19","paper":"/paper/scalable-visual-transformers-with","paper_url":"https://arxiv.org/abs/2103.10619v2","paper_title":"Scalable Vision Transformers with Hierarchical Pooling","code":"https://github.com/BR-IDL/PaddleViT","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":1027,"model":"GhostNetV3 0.5x","metrics":{"Top 1 Accuracy":"69.4%","Top 5 Accuracy":"88.5"},"uses_additional_data":false,"paper_date":"2024-04-17","paper":"/paper/ghostnetv3-exploring-the-training-strategies","paper_url":"https://arxiv.org/abs/2404.11202v2","paper_title":"GhostNetV3: Exploring the Training Strategies for Compact Models","code":"https://github.com/james77777778/keras-image-models","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":1028,"model":"DY-MobileNetV2 ×0.5","metrics":{"GFLOPs":"0.203","Number of params":"4M","Top 1 Accuracy":"69.4%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1029,"model":"AsymmNet-Large ×0.5","metrics":{"GFLOPs":"0.1344","Number of params":"2.8M","Top 1 Accuracy":"69.2%"},"uses_additional_data":false,"paper_date":"2021-04-15","paper":"/paper/asymmnet-towards-ultralight-convolution","paper_url":"https://arxiv.org/abs/2104.07770v1","paper_title":"AsymmNet: Towards ultralight convolution neural networks using asymmetrical bottlenecks","code":"https://github.com/Spark001/AsymmNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":1030,"model":"SimpleNetV1-small-05-correct-labels","metrics":{"Number of params":"1.5M","Top 1 Accuracy":"69.11"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":1031,"model":"Heteroscedastic (InceptionResNet-v2)","metrics":{"Top 1 Accuracy":"68.6%"},"uses_additional_data":false,"paper_date":"2021-05-19","paper":"/paper/correlated-input-dependent-label-noise-in","paper_url":"https://arxiv.org/abs/2105.10305v1","paper_title":"Correlated Input-Dependent Label Noise in Large-Scale Image Classification","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1032,"model":"AsymmNet-Small ×1.0","metrics":{"GFLOPs":"0.1154","Number of params":"3.1M","Top 1 Accuracy":"68.4%"},"uses_additional_data":false,"paper_date":"2021-04-15","paper":"/paper/asymmnet-towards-ultralight-convolution","paper_url":"https://arxiv.org/abs/2104.07770v1","paper_title":"AsymmNet: Towards ultralight convolution neural networks using asymmetrical bottlenecks","code":"https://github.com/Spark001/AsymmNet","n_code_links":1,"syntology":null},{"rank_in_archive_order":1033,"model":"FireCaffe (GoogLeNet)","metrics":{"Top 1 Accuracy":"68.3%"},"uses_additional_data":false,"paper_date":"2015-10-31","paper":"/paper/firecaffe-near-linear-acceleration-of-deep","paper_url":"http://arxiv.org/abs/1511.00175v2","paper_title":"FireCaffe: near-linear acceleration of deep neural network training on compute clusters","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1034,"model":"Graph-RISE (40M)","metrics":{"Top 1 Accuracy":"68.29%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/graph-rise-graph-regularized-image-semantic","paper_url":"http://arxiv.org/abs/1902.10814v1","paper_title":"Graph-RISE: Graph-Regularized Image Semantic Embedding","code":"https://github.com/tensorflow/neural-structured-learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":1035,"model":"SimpleNetV1-small-075","metrics":{"Number of params":"3M","Top 1 Accuracy":"68.15"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":1036,"model":"ReActNet-A (BN-Free)","metrics":{"Top 1 Accuracy":"68.0%"},"uses_additional_data":false,"paper_date":"2021-04-16","paper":"/paper/bnn-bn-training-binary-neural-networks","paper_url":"https://arxiv.org/abs/2104.08215v1","paper_title":"\"BNN - BN = ?\": Training Binary Neural Networks without Batch Normalization","code":"https://github.com/VITA-Group/BNN_NoBN","n_code_links":1,"syntology":{"n_ran":4,"n_unverified":7,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":1037,"model":"ResNet34 (FSGDM)","metrics":{"Top 1 Accuracy":"67.74%"},"uses_additional_data":false,"paper_date":"2024-11-29","paper":"/paper/on-the-performance-analysis-of-momentum","paper_url":"https://arxiv.org/abs/2411.19671v6","paper_title":"On the Performance Analysis of Momentum Method: A Frequency Domain Perspective","code":"https://github.com/yinleung/FSGDM","n_code_links":1,"syntology":{"n_ran":1,"n_unverified":1,"n_samples":2,"n_pointer_only_licence":0}},{"rank_in_archive_order":1038,"model":"DY-ResNet-10","metrics":{"GFLOPs":"1.82","Number of params":"18.6M","Top 1 Accuracy":"67.7%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1039,"model":"WaveMixLite-256/24","metrics":{"Number of params":"32.4M","Top 1 Accuracy":"67.7%"},"uses_additional_data":false,"paper_date":"2022-10-13","paper":"/paper/wavemix-lite-a-resource-efficient-neural-1","paper_url":"https://openreview.net/forum?id=y_icnxeeUcl","paper_title":"WaveMix-Lite: A Resource-efficient Neural Network for Image Analysis","code":"https://github.com/pranavphoenix/WaveMix","n_code_links":1,"syntology":null},{"rank_in_archive_order":1040,"model":"PSN (SEW ResNet-18)","metrics":{"Top 1 Accuracy":"67.63"},"uses_additional_data":false,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1041,"model":"MUXNet-xs","metrics":{"GFLOPs":"0.132","Number of params":"1.8M","Top 1 Accuracy":"66.7%"},"uses_additional_data":false,"paper_date":"2020-03-31","paper":"/paper/muxconv-information-multiplexing-in","paper_url":"https://arxiv.org/abs/2003.13880v2","paper_title":"MUXConv: Information Multiplexing in Convolutional Neural Networks","code":"https://github.com/human-analysis/MUXConv","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":5}},{"rank_in_archive_order":1042,"model":"PAWS (ResNet-50, 1% labels)","metrics":{"Top 1 Accuracy":"66.5%"},"uses_additional_data":false,"paper_date":"2021-04-28","paper":"/paper/semi-supervised-learning-of-visual-features","paper_url":"https://arxiv.org/abs/2104.13963v3","paper_title":"Semi-Supervised Learning of Visual Features by Non-Parametrically Predicting View Assignments with Support Samples","code":"https://github.com/facebookresearch/suncet","n_code_links":4,"syntology":{"n_ran":7,"n_unverified":14,"n_samples":21,"n_pointer_only_licence":3}},{"rank_in_archive_order":1043,"model":"GhostNet ×0.5","metrics":{"GFLOPs":"0.042","Number of params":"2.6M","Top 1 Accuracy":"66.2%"},"uses_additional_data":false,"paper_date":"2019-11-27","paper":"/paper/ghostnet-more-features-from-cheap-operations","paper_url":"https://arxiv.org/abs/1911.11907v2","paper_title":"GhostNet: More Features from Cheap Operations","code":"https://github.com/rwightman/pytorch-image-models","n_code_links":33,"syntology":{"n_ran":6,"n_unverified":17,"n_samples":23,"n_pointer_only_licence":4}},{"rank_in_archive_order":1044,"model":"OverFeat","metrics":{"Top 1 Accuracy":"66.04","Top 5 Accuracy":"86.76"},"uses_additional_data":true,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1045,"model":"DGPPF-MobileNetV2","metrics":{"GFLOPs":"0.1","Number of params":"1.03M","Top 1 Accuracy":"65.59%"},"uses_additional_data":false,"paper_date":"2024-02-15","paper":"/paper/distilled-gradual-pruning-with-pruned-fine","paper_url":"https://ieeexplore.ieee.org/document/10438214","paper_title":"Distilled Gradual Pruning with Pruned Fine-tuning","code":"https://github.com/rom42pla/dg2pf","n_code_links":1,"syntology":null},{"rank_in_archive_order":1046,"model":"DGPPF-ResNet18","metrics":{"GFLOPs":"0.2","Number of params":"1.15M","Top 1 Accuracy":"65.22"},"uses_additional_data":false,"paper_date":"2024-02-15","paper":"/paper/distilled-gradual-pruning-with-pruned-fine","paper_url":"https://ieeexplore.ieee.org/document/10438214","paper_title":"Distilled Gradual Pruning with Pruned Fine-tuning","code":"https://github.com/rom42pla/dg2pf","n_code_links":1,"syntology":null},{"rank_in_archive_order":1047,"model":"OTTT","metrics":{"Top 1 Accuracy":"65.15%"},"uses_additional_data":false,"paper_date":"2022-10-09","paper":"/paper/online-training-through-time-for-spiking","paper_url":"https://arxiv.org/abs/2210.04195v2","paper_title":"Online Training Through Time for Spiking Neural Networks","code":"https://github.com/pkuxmq/ottt-snn","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":1048,"model":"DY-MobileNetV2 ×0.35","metrics":{"GFLOPs":"0.124","Number of params":"2.8M","Top 1 Accuracy":"64.9%"},"uses_additional_data":false,"paper_date":"2019-12-07","paper":"/paper/dynamic-convolution-attention-over","paper_url":"https://arxiv.org/abs/1912.03458v2","paper_title":"Dynamic Convolution: Attention over Convolution Kernels","code":"https://github.com/xmu-xiaoma666/External-Attention-pytorch","n_code_links":5,"syntology":{"n_ran":1,"n_unverified":3,"n_samples":4,"n_pointer_only_licence":0}},{"rank_in_archive_order":1049,"model":"Alexnet","metrics":{"Number of params":"62M","Top 1 Accuracy":"63.3","Top 5 Accuracy":"84.6"},"uses_additional_data":true,"paper_date":null,"paper":null,"paper_url":null,"paper_title":"","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1050,"model":"BBG (ResNet-34)","metrics":{"Top 1 Accuracy":"62.6%"},"uses_additional_data":false,"paper_date":"2019-09-26","paper":"/paper/balanced-binary-neural-networks-with-gated","paper_url":"https://arxiv.org/abs/1909.12117v2","paper_title":"Balanced Binary Neural Networks with Gated Residual","code":"https://github.com/JDAI-CV/dabnn","n_code_links":1,"syntology":null},{"rank_in_archive_order":1051,"model":"SimpleNetV1-small-05","metrics":{"Number of params":"1.5M","Top 1 Accuracy":"61.52"},"uses_additional_data":false,"paper_date":"2016-08-22","paper":"/paper/lets-keep-it-simple-using-simple","paper_url":"https://arxiv.org/abs/1608.06037v8","paper_title":"Lets keep it simple, Using simple architectures to outperform deeper and more complex architectures","code":"https://github.com/Coderx7/SimpleNet","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":8,"n_samples":11,"n_pointer_only_licence":0}},{"rank_in_archive_order":1052,"model":"BBG (ResNet-18)","metrics":{"Top 1 Accuracy":"59.4%"},"uses_additional_data":false,"paper_date":"2019-09-26","paper":"/paper/balanced-binary-neural-networks-with-gated","paper_url":"https://arxiv.org/abs/1909.12117v2","paper_title":"Balanced Binary Neural Networks with Gated Residual","code":"https://github.com/JDAI-CV/dabnn","n_code_links":1,"syntology":null},{"rank_in_archive_order":1053,"model":"FireCaffe (AlexNet)","metrics":{"Top 1 Accuracy":"58.9%"},"uses_additional_data":false,"paper_date":"2015-10-31","paper":"/paper/firecaffe-near-linear-acceleration-of-deep","paper_url":"http://arxiv.org/abs/1511.00175v2","paper_title":"FireCaffe: near-linear acceleration of deep neural network training on compute clusters","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1054,"model":"HMAX","metrics":{"Top 1 Accuracy":"38.3%"},"uses_additional_data":false,"paper_date":"2022-06-19","paper":"/paper/0-1-deep-neural-networks-via-block-coordinate","paper_url":"https://arxiv.org/abs/2206.09379v2","paper_title":"0/1 Deep Neural Networks via Block Coordinate Descent","code":null,"n_code_links":0,"syntology":null},{"rank_in_archive_order":1055,"model":"ViT-Large","metrics":{"Top 1 Accuracy":"24%"},"uses_additional_data":false,"paper_date":"2020-10-22","paper":"/paper/an-image-is-worth-16x16-words-transformers-1","paper_url":"https://arxiv.org/abs/2010.11929v2","paper_title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","code":"https://github.com/huggingface/transformers","n_code_links":158,"syntology":{"n_ran":281,"n_unverified":138,"n_samples":419,"n_pointer_only_licence":154}},{"rank_in_archive_order":1056,"model":"CCT-14/7x2","metrics":{"GFLOPs":"11.06","Number of params":"22.36M"},"uses_additional_data":false,"paper_date":"2021-04-12","paper":"/paper/escaping-the-big-data-paradigm-with-compact","paper_url":"https://arxiv.org/abs/2104.05704v4","paper_title":"Escaping the Big Data Paradigm with Compact Transformers","code":"https://github.com/keras-team/keras-io/blob/master/examples/vision/cct.py","n_code_links":9,"syntology":{"n_ran":3,"n_unverified":3,"n_samples":6,"n_pointer_only_licence":1}},{"rank_in_archive_order":1057,"model":"MambaVision-L2","metrics":{"Number of params":"241.5M"},"uses_additional_data":false,"paper_date":"2024-07-10","paper":"/paper/mambavision-a-hybrid-mamba-transformer-vision","paper_url":"https://arxiv.org/abs/2407.08083v2","paper_title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","code":"https://github.com/nvlabs/mambavision","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":6,"n_samples":8,"n_pointer_only_licence":6}},{"rank_in_archive_order":1058,"model":"ONE-PEACE","metrics":{"Number of params":"1520M"},"uses_additional_data":false,"paper_date":"2023-05-18","paper":"/paper/one-peace-exploring-one-general","paper_url":"https://arxiv.org/abs/2305.11172v1","paper_title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","code":"https://github.com/modelscope/modelscope","n_code_links":2,"syntology":{"n_ran":2,"n_unverified":5,"n_samples":7,"n_pointer_only_licence":0}},{"rank_in_archive_order":1059,"model":"AIMv2-2B","metrics":{"Number of params":"2700M"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":1060,"model":"InternImage-DCNv3-G (M3I Pre-training)","metrics":{"Number of params":"3000M"},"uses_additional_data":false,"paper_date":"2022-11-10","paper":"/paper/internimage-exploring-large-scale-vision","paper_url":"https://arxiv.org/abs/2211.05778v4","paper_title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","code":"https://github.com/opengvlab/internimage","n_code_links":3,"syntology":{"n_ran":2,"n_unverified":2,"n_samples":4,"n_pointer_only_licence":0}}],"since_archive":{"claim":"Results that newer papers report for their own method, placed here by Syntology. A model pointed at the cell in the paper's own table; the number was read from that cell and checked against this leaderboard's metric, dataset, split and scale; an independent check that saw this leaderboard's other rows and every other leaderboard on the same dataset accepted it. Not reviewed by the paper's authors or by the archive's editors, and not ranked against the archive rows.","extraction_file_present":true,"measurement":{"test_papers":883,"papers_with_output":881,"judged_true":108,"judged":110,"wilson95_lower":0.9361,"measured_on":"2026-09-24","frozen_commit":"0e3de0df94"},"measurement_note":"blind adjudication of accepted entries on a held-out split of archive papers, rules frozen before the test","coverage":{"sentence":"Syntology has checked 6,795 of the 9,581 papers on this site that are newer than the archive; results from the others appear after they are checked.","complete":false,"papers_newer_than_archive":9581,"papers_checked":6795,"papers_extracted_not_yet_verified":0,"boards_without_verdict":2,"papers_not_yet_extracted":2785},"order":"newest first by month (arXiv date, else the arXiv-id month), then arXiv id descending","columns":[],"entries":[]},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":712,"rows_with_any_sample_ran":619,"distinct_papers_with_graph_line":217,"distinct_papers_with_any_sample_ran":192,"samples_over_distinct_papers":{"n_ran":2517,"n_unverified":2138,"n_samples":4655,"n_pointer_only_licence":1299,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":9046,"n_unverified":7767,"n_samples":16813,"n_pointer_only_licence":4459,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}