{"url":"/sota/image-classification-on-inaturalist","task":{"name":"Image Classification","url":"/task/image-classification","note":null},"dataset":{"name":"iNaturalist","url":"/dataset/inaturalist"},"category":"Computer Vision","categories":["Adversarial","Computer Vision"],"category_note":null,"description":"**Image Classification** is a fundamental task in vision recognition that aims to understand and categorize an image as a whole under a specific label. Unlike [object detection](/task/object-detection), which involves classification and location of multiple objects within an image, image classification typically pertains to single-object images. When the classification becomes highly detailed or reaches instance-level, it is often referred to as [image retrieval](/task/image-retrieval), which also involves finding similar images in a large database.\r\n\r\n\r\n<span class=\"description-source\">Source: [Metamorphic Testing for Object Detection Systems ](https://arxiv.org/abs/1912.12162)</span>","description_from":"task","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","rank":"the archive's row order at snapshot; not re-ranked","rows_end_at":"2025-07-28","rows_withheld_as_spam":0,"metric_values":"the archive's strings, untouched"},"metrics":["Top 1 Accuracy","Top 5 Accuracy","Top 3 Error","Overall"],"metric_direction":{"note":"inferred from the metric name only (the archive records no direction); null = not inferred, chart draws points only","by_metric":{"Top 1 Accuracy":"higher","Top 5 Accuracy":"higher","Top 3 Error":"lower","Overall":null}},"counts":{"rows":19,"rows_with_code":19,"rows_with_paper_page":19,"rows_dated":19,"rows_using_additional_data":5},"rows":[{"rank_in_archive_order":1,"model":"AIMv2-3B (448 res)","metrics":{"Top 1 Accuracy":"85.9"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":2,"model":"Hiera-H (448px)","metrics":{"Top 1 Accuracy":"83.8"},"uses_additional_data":true,"paper_date":"2023-06-01","paper":"/paper/hiera-a-hierarchical-vision-transformer","paper_url":"https://arxiv.org/abs/2306.00989v1","paper_title":"Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles","code":"https://github.com/huggingface/pytorch-image-models","n_code_links":4,"syntology":{"n_ran":0,"n_unverified":6,"n_samples":6,"n_pointer_only_licence":0}},{"rank_in_archive_order":3,"model":"MAE (ViT-H, 448)","metrics":{"Top 1 Accuracy":"83.4"},"uses_additional_data":true,"paper_date":"2021-11-11","paper":"/paper/masked-autoencoders-are-scalable-vision","paper_url":"https://arxiv.org/abs/2111.06377v2","paper_title":"Masked Autoencoders Are Scalable Vision Learners","code":"https://github.com/facebookresearch/mae","n_code_links":58,"syntology":{"n_ran":71,"n_unverified":66,"n_samples":137,"n_pointer_only_licence":73}},{"rank_in_archive_order":4,"model":"MetaFormer\n(MetaFormer-2,384,extra_info)","metrics":{"Top 1 Accuracy":"83.4%"},"uses_additional_data":true,"paper_date":"2022-03-05","paper":"/paper/metaformer-a-unified-meta-framework-for-fine","paper_url":"https://arxiv.org/abs/2203.02751v1","paper_title":"MetaFormer: A Unified Meta Framework for Fine-Grained Recognition","code":"https://github.com/dqshuai/metaformer","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":13,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":5,"model":"AIMv2-3B","metrics":{"Top 1 Accuracy":"81.5"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":6,"model":"ViT-NeT\n(SwinV2-B)","metrics":{"Top 1 Accuracy":"81.2"},"uses_additional_data":false,"paper_date":"2022-07-17","paper":"/paper/vit-net-interpretable-vision-transformers","paper_url":"https://proceedings.mlr.press/v162/kim22g/kim22g.pdf","paper_title":"ViT-NeT: Interpretable Vision Transformers with Neural Tree Decoder","code":"https://github.com/jumpsnack/ViT-NeT","n_code_links":1,"syntology":null},{"rank_in_archive_order":7,"model":"MetaFormer\n(MetaFormer-2,384)","metrics":{"Top 1 Accuracy":"80.4%"},"uses_additional_data":true,"paper_date":"2022-03-05","paper":"/paper/metaformer-a-unified-meta-framework-for-fine","paper_url":"https://arxiv.org/abs/2203.02751v1","paper_title":"MetaFormer: A Unified Meta Framework for Fine-Grained Recognition","code":"https://github.com/dqshuai/metaformer","n_code_links":2,"syntology":{"n_ran":1,"n_unverified":13,"n_samples":14,"n_pointer_only_licence":0}},{"rank_in_archive_order":8,"model":"AIMv2-1B","metrics":{"Top 1 Accuracy":"79.7"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":9,"model":"AIMv2-H","metrics":{"Top 1 Accuracy":"77.9"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":10,"model":"AIMv2-L","metrics":{"Top 1 Accuracy":"76"},"uses_additional_data":false,"paper_date":"2024-11-21","paper":"/paper/multimodal-autoregressive-pre-training-of","paper_url":"https://arxiv.org/abs/2411.14402v1","paper_title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","code":"https://github.com/apple/ml-aim","n_code_links":1,"syntology":{"n_ran":0,"n_unverified":3,"n_samples":3,"n_pointer_only_licence":3}},{"rank_in_archive_order":11,"model":"FixSENet-154","metrics":{"Top 1 Accuracy":"75.4"},"uses_additional_data":true,"paper_date":"2019-06-14","paper":"/paper/fixing-the-train-test-resolution-discrepancy","paper_url":"https://arxiv.org/abs/1906.06423v4","paper_title":"Fixing the train-test resolution discrepancy","code":"https://github.com/facebookresearch/FixRes","n_code_links":3,"syntology":{"n_ran":0,"n_unverified":2,"n_samples":2,"n_pointer_only_licence":2}},{"rank_in_archive_order":12,"model":"SEB+EfficientNet-B5","metrics":{"Top 1 Accuracy":"72.3"},"uses_additional_data":false,"paper_date":"2022-05-26","paper":"/paper/on-the-eigenvalues-of-global-covariance","paper_url":"https://arxiv.org/abs/2205.13282v1","paper_title":"On the Eigenvalues of Global Covariance Pooling for Fine-grained Visual Recognition","code":"https://github.com/KingJamesSong/DifferentiableSVD","n_code_links":1,"syntology":{"n_ran":3,"n_unverified":14,"n_samples":17,"n_pointer_only_licence":0}},{"rank_in_archive_order":13,"model":"TransFG","metrics":{"Top 1 Accuracy":"71.7"},"uses_additional_data":false,"paper_date":"2021-03-14","paper":"/paper/transfg-a-transformer-architecture-for-fine","paper_url":"https://arxiv.org/abs/2103.07976v5","paper_title":"TransFG: A Transformer Architecture for Fine-grained Recognition","code":"https://github.com/TACJu/TransFG","n_code_links":2,"syntology":{"n_ran":3,"n_unverified":0,"n_samples":3,"n_pointer_only_licence":2}},{"rank_in_archive_order":14,"model":"IncResNetV2 SE","metrics":{"Top 1 Accuracy":"67.3%","Top 5 Accuracy":"87.5%"},"uses_additional_data":false,"paper_date":"2017-07-20","paper":"/paper/the-inaturalist-species-classification-and","paper_url":"http://arxiv.org/abs/1707.06642v2","paper_title":"The iNaturalist Species Classification and Detection Dataset","code":"https://github.com/tensorflow/models","n_code_links":21,"syntology":null},{"rank_in_archive_order":15,"model":"SpineNet-143","metrics":{"Top 1 Accuracy":"63.6%","Top 5 Accuracy":"84.8%"},"uses_additional_data":false,"paper_date":"2019-12-10","paper":"/paper/spinenet-learning-scale-permuted-backbone-for","paper_url":"https://arxiv.org/abs/1912.05027v3","paper_title":"SpineNet: Learning Scale-Permuted Backbone for Recognition and Localization","code":"https://github.com/tensorflow/models/tree/master/official/vision/beta/modeling/backbones","n_code_links":13,"syntology":null},{"rank_in_archive_order":16,"model":"MetaSAug","metrics":{"Top 1 Accuracy":"63.28%"},"uses_additional_data":false,"paper_date":"2021-03-23","paper":"/paper/metasaug-meta-semantic-augmentation-for-long","paper_url":"https://arxiv.org/abs/2103.12579v3","paper_title":"MetaSAug: Meta Semantic Augmentation for Long-Tailed Visual Recognition","code":"https://github.com/BIT-DA/MetaSAug","n_code_links":1,"syntology":{"n_ran":2,"n_unverified":1,"n_samples":3,"n_pointer_only_licence":0}},{"rank_in_archive_order":17,"model":"Graph-RISE (40M)","metrics":{"Top 1 Accuracy":"31.12%","Top 5 Accuracy":"52.76%"},"uses_additional_data":false,"paper_date":"2019-02-14","paper":"/paper/graph-rise-graph-regularized-image-semantic","paper_url":"http://arxiv.org/abs/1902.10814v1","paper_title":"Graph-RISE: Graph-Regularized Image Semantic Embedding","code":"https://github.com/tensorflow/neural-structured-learning","n_code_links":1,"syntology":null},{"rank_in_archive_order":18,"model":"iSQRT-COV-Net","metrics":{"Top 3 Error":"14.625"},"uses_additional_data":false,"paper_date":"2019-04-15","paper":"/paper/deep-cnns-meet-global-covariance-pooling","paper_url":"https://arxiv.org/abs/1904.06836v2","paper_title":"Deep CNNs Meet Global Covariance Pooling: Better Representation and Generalization","code":"https://github.com/jiangtaoxie/fast-MPN-COV","n_code_links":3,"syntology":{"n_ran":3,"n_unverified":2,"n_samples":5,"n_pointer_only_licence":3}},{"rank_in_archive_order":19,"model":"b_22DeiT-LT(ours)","metrics":{"Overall":"75.1"},"uses_additional_data":false,"paper_date":"2024-04-03","paper":"/paper/deit-lt-distillation-strikes-back-for-vision","paper_url":"https://arxiv.org/abs/2404.02900v1","paper_title":"DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets","code":"https://github.com/val-iisc/DeiT-LT","n_code_links":2,"syntology":null}],"since_archive":{"present":false,"note":"No Syntology-extracted rows are published in this build."},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per row: N of M harvested code samples from that row's paper executed on a synthesized fixture; the other M-N are unverified. Not a reproduction of the row's number; not a correctness claim. n_pointer_only_licence counts samples the site points at rather than redistributes (a licence axis, independent of ran/unverified).","rows_with_graph_line":14,"rows_with_any_sample_ran":7,"distinct_papers_with_graph_line":9,"distinct_papers_with_any_sample_ran":6,"samples_over_distinct_papers":{"n_ran":83,"n_unverified":107,"n_samples":190,"n_pointer_only_licence":83,"note":"each paper (arXiv id) counted once, however many rows it is behind; this is the page-level figure"},"samples_row_weighted":{"n_ran":84,"n_unverified":132,"n_samples":216,"n_pointer_only_licence":95,"note":"row-weighted: a paper behind several rows is counted once per row; inflated relative to samples_over_distinct_papers by design, kept for readers summing the per-row syntology blocks"}}}