{"url":"/task/fine-grained-image-classification","name":"Fine-Grained Image Classification","slug":"fine-grained-image-classification","description_markdown":"**Fine-Grained Image Classification** is a task in computer vision where the goal is to classify images into subcategories within a larger category. For example, classifying different species of birds or different types of flowers. This task is considered to be fine-grained because it requires the model to distinguish between subtle differences in visual appearance and patterns, making it more challenging than regular image classification tasks.\r\n\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Looking for the Devil in the Details](https://arxiv.org/pdf/1903.06150v2.pdf) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":353,"papers_with_code":200,"benchmarks":36,"benchmark_tables_in_archive":36,"benchmark_tables_shown":36,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":41,"subtasks":1,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/fine-grained-image-classification-on-stanford","slug":"fine-grained-image-classification-on-stanford","dataset":"Stanford Cars","dataset_url":"/dataset/stanford-cars","rows_in_archive":83,"metrics":["Accuracy","FLOPS","PARAMS"],"first_row_in_archive_order":{"model":"TResnet-L + PMD","paper_title":"Progressive Multi-task Anti-Noise Learning and Distilling Frameworks for Fine-grained Vehicle Recognition","paper_url":"/paper/progressive-multi-task-anti-noise-learning","paper_date":"2024-01-25","arxiv_id":"2401.14336","code_links":[{"title":"dichao-liu/anti-noise_fgvr","url":"https://github.com/dichao-liu/anti-noise_fgvr"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-fgvc","slug":"fine-grained-image-classification-on-fgvc","dataset":"FGVC Aircraft","dataset_url":"/dataset/fgvc-aircraft-1","rows_in_archive":57,"metrics":["Accuracy","Top-1 Error Rate","FLOPS","PARAMS","Top-1"],"first_row_in_archive_order":{"model":"I2-HOFI","paper_title":"Interweaving Insights: High-Order Feature Interaction for Fine-Grained Visual Recognition","paper_url":"/paper/interweaving-insights-high-order-feature","paper_date":"2024-10-20","arxiv_id":null,"code_links":[{"title":"arindam-1991/i2-hofi","url":"https://github.com/arindam-1991/i2-hofi"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-cub-200-1","slug":"fine-grained-image-classification-on-cub-200-1","dataset":"CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":30,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"HERBS","paper_title":"Fine-grained Visual Classification with High-temperature Refinement and Background Suppression","paper_url":"/paper/fine-grained-visual-classification-with-high-1","paper_date":"2023-03-11","arxiv_id":"2303.06442","code_links":[{"title":"chou141253/FGVC-HERBS","url":"https://github.com/chou141253/FGVC-HERBS"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-nabirds","slug":"fine-grained-image-classification-on-nabirds","dataset":"NABirds","dataset_url":"/dataset/nabirds","rows_in_archive":30,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MetaFormer\n(MetaFormer-2,384)","paper_title":"MetaFormer: A Unified Meta Framework for Fine-Grained Recognition","paper_url":"/paper/metaformer-a-unified-meta-framework-for-fine","paper_date":"2022-03-05","arxiv_id":"2203.02751","code_links":[{"title":"dqshuai/metaformer","url":"https://github.com/dqshuai/metaformer"},{"title":"salluru007/papers","url":"https://github.com/salluru007/papers"}],"syntology":{"n":14,"n_ran":1,"n_unverified":13,"n_pointer_only":0}}},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford","slug":"fine-grained-image-classification-on-oxford","dataset":"Oxford 102 Flowers","dataset_url":"/dataset/oxford-102-flower","rows_in_archive":25,"metrics":["Accuracy","Top-1 Error Rate","FLOPS","PARAMS","Top 1 Accuracy"],"first_row_in_archive_order":{"model":"IELT","paper_title":"Fine-Grained Visual Classification via Internal Ensemble Learning Transformer","paper_url":"/paper/fine-grained-visual-classification-via-2","paper_date":"2023-02-13","arxiv_id":null,"code_links":[{"title":"mobulan/ielt","url":"https://github.com/mobulan/ielt"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-stanford-1","slug":"fine-grained-image-classification-on-stanford-1","dataset":"Stanford Dogs","dataset_url":"/dataset/stanford-dogs","rows_in_archive":24,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MP","paper_title":"SR-GNN: Spatial Relation-aware Graph Neural Network for Fine-Grained Image Categorization","paper_url":"/paper/sr-gnn-spatial-relation-aware-graph-neural","paper_date":"2022-09-05","arxiv_id":"2209.02109","code_links":[{"title":"ardhendubehera/sr-gnn","url":"https://github.com/ardhendubehera/sr-gnn"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-2","slug":"fine-grained-image-classification-on-oxford-2","dataset":"Oxford-IIIT Pets","dataset_url":"/dataset/oxford-iiit-pets-1","rows_in_archive":19,"metrics":["Accuracy","Top-1 Error Rate","FLOPS","PARAMS"],"first_row_in_archive_order":{"model":"EffNet-L2 (SAM)","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","paper_url":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_date":"2020-10-03","arxiv_id":"2010.01412","code_links":[{"title":"davda54/sam","url":"https://github.com/davda54/sam"},{"title":"google-research/sam","url":"https://github.com/google-research/sam"},{"title":"moskomule/sam.pytorch","url":"https://github.com/moskomule/sam.pytorch"},{"title":"simon20010923/DDAMFN","url":"https://github.com/simon20010923/DDAMFN"},{"title":"ys-zong/medfair","url":"https://github.com/ys-zong/medfair"},{"title":"sayakpaul/Sharpness-Aware-Minimization-TensorFlow","url":"https://github.com/sayakpaul/Sharpness-Aware-Minimization-TensorFlow"},{"title":"wangermeng2021/Scaled-YOLOv4-tensorflow2","url":"https://github.com/wangermeng2021/Scaled-YOLOv4-tensorflow2"},{"title":"Jannoshh/simple-sam","url":"https://github.com/Jannoshh/simple-sam"},{"title":"rollovd/LookSAM","url":"https://github.com/rollovd/LookSAM"},{"title":"wangermeng2021/FastClassification","url":"https://github.com/wangermeng2021/FastClassification"},{"title":"borealisai/perturbed-forgetting","url":"https://github.com/borealisai/perturbed-forgetting"},{"title":"mhassann22/GCSAM","url":"https://github.com/mhassann22/GCSAM"},{"title":"Janus-Shiau/SAM-tf2","url":"https://github.com/Janus-Shiau/SAM-tf2"},{"title":"NiMlr/pynlqn","url":"https://github.com/NiMlr/pynlqn"},{"title":"Ashay-20/TF-SAM-Sharpness-Aware-Minimization-Implementation","url":"https://github.com/Ashay-20/TF-SAM-Sharpness-Aware-Minimization-Implementation"},{"title":"Yuheon/Sharp-Aware-Minimization","url":"https://github.com/Yuheon/Sharp-Aware-Minimization"},{"title":"denizyuret/playground","url":"https://github.com/denizyuret/playground"},{"title":"MindCode-4/code-13","url":"https://github.com/MindCode-4/code-13/tree/main/Scalable-Sharpness-Aware-Minimization"}],"syntology":{"n":20,"n_ran":8,"n_unverified":12,"n_pointer_only":6}}},{"leaderboard":"/sota/fine-grained-image-classification-on-caltech","slug":"fine-grained-image-classification-on-caltech","dataset":"Caltech-101","dataset_url":"/dataset/caltech-101","rows_in_archive":18,"metrics":["Top-1 Error Rate","Accuracy"],"first_row_in_archive_order":{"model":"VIT-L/16","paper_title":"Reduction of Class Activation Uncertainty with Background Information","paper_url":"/paper/reduction-of-class-activation-uncertainty","paper_date":"2023-05-05","arxiv_id":"2305.03238","code_links":[{"title":"dipuk0506/SpinalNet","url":"https://github.com/dipuk0506/SpinalNet"},{"title":"dipuk0506/uq","url":"https://github.com/dipuk0506/uq"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-food-101","slug":"fine-grained-image-classification-on-food-101","dataset":"Food-101","dataset_url":"/dataset/food-101","rows_in_archive":15,"metrics":["Accuracy","FLOPS","PARAMS","Top 1 Accuracy"],"first_row_in_archive_order":{"model":"CAP","paper_title":"Context-aware Attentional Pooling (CAP) for Fine-grained Visual Classification","paper_url":"/paper/context-aware-attentional-pooling-cap-for","paper_date":"2021-01-17","arxiv_id":"2101.06635","code_links":[{"title":"ArdhenduBehera/cap","url":"https://github.com/ArdhenduBehera/cap"}],"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}}},{"leaderboard":"/sota/fine-grained-image-classification-on-oxford-1","slug":"fine-grained-image-classification-on-oxford-1","dataset":"Oxford-IIIT Pet Dataset","dataset_url":"/dataset/oxford-iiit-pets","rows_in_archive":15,"metrics":["Accuracy","Top-1 Error Rate","FLOPS","PARAMS"],"first_row_in_archive_order":{"model":"OmniVec2","paper_title":"OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","paper_url":"/paper/omnivec2-a-novel-transformer-based-network","paper_date":"2024-01-01","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-cub-200","slug":"fine-grained-image-classification-on-cub-200","dataset":"CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":12,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"TransFG","paper_title":"TransFG: A Transformer Architecture for Fine-grained Recognition","paper_url":"/paper/transfg-a-transformer-architecture-for-fine","paper_date":"2021-03-14","arxiv_id":"2103.07976","code_links":[{"title":"TACJu/TransFG","url":"https://github.com/TACJu/TransFG"},{"title":"skchen1993/TrangFG","url":"https://github.com/skchen1993/TrangFG"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":2}}},{"leaderboard":"/sota/fine-grained-image-classification-on-compcars","slug":"fine-grained-image-classification-on-compcars","dataset":"CompCars","dataset_url":"/dataset/compcars","rows_in_archive":7,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Resnet50 + PMAL","paper_title":"Progressive Multi-task Anti-Noise Learning and Distilling Frameworks for Fine-grained Vehicle Recognition","paper_url":"/paper/progressive-multi-task-anti-noise-learning","paper_date":"2024-01-25","arxiv_id":"2401.14336","code_links":[{"title":"dichao-liu/anti-noise_fgvr","url":"https://github.com/dichao-liu/anti-noise_fgvr"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-bird-225","slug":"fine-grained-image-classification-on-bird-225","dataset":"Bird-225","dataset_url":"/dataset/bird","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"WideResNet-101 (Spinal FC)","paper_title":"A Comprehensive Study on Torchvision Pre-trained Models for Fine-grained Inter-species Classification","paper_url":"/paper/a-comprehensive-study-on-torchvision-pre","paper_date":"2021-10-14","arxiv_id":"2110.07097","code_links":[{"title":"dipuk0506/SpinalNet","url":"https://github.com/dipuk0506/SpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-birdsnap","slug":"fine-grained-image-classification-on-birdsnap","dataset":"Birdsnap","dataset_url":"/dataset/birdsnap","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"EffNet-L2 (SAM)","paper_title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","paper_url":"/paper/sharpness-aware-minimization-for-efficiently-1","paper_date":"2020-10-03","arxiv_id":"2010.01412","code_links":[{"title":"davda54/sam","url":"https://github.com/davda54/sam"},{"title":"google-research/sam","url":"https://github.com/google-research/sam"},{"title":"moskomule/sam.pytorch","url":"https://github.com/moskomule/sam.pytorch"},{"title":"simon20010923/DDAMFN","url":"https://github.com/simon20010923/DDAMFN"},{"title":"ys-zong/medfair","url":"https://github.com/ys-zong/medfair"},{"title":"sayakpaul/Sharpness-Aware-Minimization-TensorFlow","url":"https://github.com/sayakpaul/Sharpness-Aware-Minimization-TensorFlow"},{"title":"wangermeng2021/Scaled-YOLOv4-tensorflow2","url":"https://github.com/wangermeng2021/Scaled-YOLOv4-tensorflow2"},{"title":"Jannoshh/simple-sam","url":"https://github.com/Jannoshh/simple-sam"},{"title":"rollovd/LookSAM","url":"https://github.com/rollovd/LookSAM"},{"title":"wangermeng2021/FastClassification","url":"https://github.com/wangermeng2021/FastClassification"},{"title":"borealisai/perturbed-forgetting","url":"https://github.com/borealisai/perturbed-forgetting"},{"title":"mhassann22/GCSAM","url":"https://github.com/mhassann22/GCSAM"},{"title":"Janus-Shiau/SAM-tf2","url":"https://github.com/Janus-Shiau/SAM-tf2"},{"title":"NiMlr/pynlqn","url":"https://github.com/NiMlr/pynlqn"},{"title":"Ashay-20/TF-SAM-Sharpness-Aware-Minimization-Implementation","url":"https://github.com/Ashay-20/TF-SAM-Sharpness-Aware-Minimization-Implementation"},{"title":"Yuheon/Sharp-Aware-Minimization","url":"https://github.com/Yuheon/Sharp-Aware-Minimization"},{"title":"denizyuret/playground","url":"https://github.com/denizyuret/playground"},{"title":"MindCode-4/code-13","url":"https://github.com/MindCode-4/code-13/tree/main/Scalable-Sharpness-Aware-Minimization"}],"syntology":{"n":20,"n_ran":8,"n_unverified":12,"n_pointer_only":6}}},{"leaderboard":"/sota/fine-grained-image-classification-on-sun397","slug":"fine-grained-image-classification-on-sun397","dataset":"SUN397","dataset_url":"/dataset/sun397","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"µ2Net (ViT-L/16)","paper_title":"An Evolutionary Approach to Dynamic Introduction of Tasks in Large-scale Multitask Learning Systems","paper_url":"/paper/an-evolutionary-approach-to-dynamic","paper_date":"2022-05-25","arxiv_id":"2205.12755","code_links":[{"title":"google-research/google-research","url":"https://github.com/google-research/google-research/tree/master/muNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-10","slug":"fine-grained-image-classification-on-10","dataset":"10 Monkey Species","dataset_url":null,"rows_in_archive":4,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Inception-v3 (Spinal FC)","paper_title":"A Comprehensive Study on Torchvision Pre-trained Models for Fine-grained Inter-species Classification","paper_url":"/paper/a-comprehensive-study-on-torchvision-pre","paper_date":"2021-10-14","arxiv_id":"2110.07097","code_links":[{"title":"dipuk0506/SpinalNet","url":"https://github.com/dipuk0506/SpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-fruits","slug":"fine-grained-image-classification-on-fruits","dataset":"Fruits-360","dataset_url":null,"rows_in_archive":3,"metrics":["Accuracy (%)","Accuracy"],"first_row_in_archive_order":{"model":"ResNeXt-101","paper_title":"A Comprehensive Study on Torchvision Pre-trained Models for Fine-grained Inter-species Classification","paper_url":"/paper/a-comprehensive-study-on-torchvision-pre","paper_date":"2021-10-14","arxiv_id":"2110.07097","code_links":[{"title":"dipuk0506/SpinalNet","url":"https://github.com/dipuk0506/SpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-foodx","slug":"fine-grained-image-classification-on-foodx","dataset":"FoodX-251","dataset_url":"/dataset/foodx-251","rows_in_archive":2,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"CSWin-L","paper_title":"Learning Multi-Subset of Classes for Fine-Grained Food Recognition","paper_url":"/paper/learning-multi-subset-of-classes-for-fine","paper_date":"2022-10-10","arxiv_id":null,"code_links":[{"title":"javierrodenas/Learning-Multi-Subset-of-Classes-for-Fine-Grained-Recognition","url":"https://github.com/javierrodenas/Learning-Multi-Subset-of-Classes-for-Fine-Grained-Recognition"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on","slug":"fine-grained-image-classification-on","dataset":"Imbalanced CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":1,"metrics":["Accuracy","Average Per-Class Accuracy"],"first_row_in_archive_order":{"model":"PC-Softmax","paper_title":"Rethinking Softmax with Cross-Entropy: Neural Network Classifier as Mutual Information Estimator","paper_url":"/paper/rethinking-softmax-with-cross-entropy-neural","paper_date":"2019-11-25","arxiv_id":"1911.10688","code_links":[{"title":"ZhenyueQin/Research-Softmax-with-Mutual-Information","url":"https://github.com/ZhenyueQin/Research-Softmax-with-Mutual-Information"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-1","slug":"fine-grained-image-classification-on-1","dataset":"Kuzushiji-MNIST","dataset_url":"/dataset/kuzushiji-mnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VGG-5","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-2","slug":"fine-grained-image-classification-on-2","dataset":"BoxCars116K","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ResNet152 + COOC","paper_title":"Fine-Grained Vehicle Classification with Unsupervised Parts Co-occurrence Learning","paper_url":"/paper/fine-grained-vehicle-classification-with","paper_date":"2019-01-23","arxiv_id":null,"code_links":[],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-3","slug":"fine-grained-image-classification-on-3","dataset":"iNaturalist","dataset_url":"/dataset/inaturalist","rows_in_archive":1,"metrics":["Top 1 Accuracy"],"first_row_in_archive_order":{"model":"TASN","paper_title":"Looking for the Devil in the Details: Learning Trilinear Attention Sampling Network for Fine-grained Image Recognition","paper_url":"/paper/looking-for-the-devil-in-the-details-learning","paper_date":"2019-03-14","arxiv_id":"1903.06150","code_links":[{"title":"researchmm/tasn","url":"https://github.com/researchmm/tasn"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-4","slug":"fine-grained-image-classification-on-4","dataset":"Herbarium 2021 Half–Earth","dataset_url":"/dataset/herbarium-2021-half-earth","rows_in_archive":1,"metrics":["Test F1 score"],"first_row_in_archive_order":{"model":"Conviformer-B","paper_title":"Conviformers: Convolutionally guided Vision Transformer","paper_url":"/paper/conviformers-convolutionally-guided-vision","paper_date":"2022-08-17","arxiv_id":"2208.08900","code_links":[{"title":"vaishnavmohit/Conviformer","url":"https://github.com/vaishnavmohit/Conviformer"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-5","slug":"fine-grained-image-classification-on-5","dataset":"Herbarium 2022","dataset_url":"/dataset/herbarium-2022","rows_in_archive":1,"metrics":["Test F1 score (private)"],"first_row_in_archive_order":{"model":"Conviformer-B","paper_title":"Conviformers: Convolutionally guided Vision Transformer","paper_url":"/paper/conviformers-convolutionally-guided-vision","paper_date":"2022-08-17","arxiv_id":"2208.08900","code_links":[{"title":"vaishnavmohit/Conviformer","url":"https://github.com/vaishnavmohit/Conviformer"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-bottles","slug":"fine-grained-image-classification-on-bottles","dataset":"Bottles","dataset_url":null,"rows_in_archive":1,"metrics":["mAP"],"first_row_in_archive_order":{"model":"PHOC descriptor + Fisher Vector Encoding","paper_title":"Fine-grained Image Classification and Retrieval by Combining Visual and Locally Pooled Textual Features","paper_url":"/paper/fine-grained-image-classification-and","paper_date":"2020-01-14","arxiv_id":"2001.04732","code_links":[{"title":"DreadPiratePsyopus/Fine_Grained_Clf","url":"https://github.com/DreadPiratePsyopus/Fine_Grained_Clf"},{"title":"AndresPMD/Fine_Grained_Clf","url":"https://github.com/AndresPMD/Fine_Grained_Clf"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-carflag","slug":"fine-grained-image-classification-on-carflag","dataset":"CarFlag-1532","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ResNet101-swp","paper_title":"Deep CNNs With Spatially Weighted Pooling for Fine-Grained Car Recognition","paper_url":"/paper/deep-cnns-with-spatially-weighted-pooling-for","paper_date":"2017-04-04","arxiv_id":null,"code_links":[{"title":"duongttr/SWP","url":"https://github.com/duongttr/SWP"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-carflag-1","slug":"fine-grained-image-classification-on-carflag-1","dataset":"CarFlag-563","dataset_url":null,"rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"ResNet101-swp","paper_title":"Deep CNNs With Spatially Weighted Pooling for Fine-Grained Car Recognition","paper_url":"/paper/deep-cnns-with-spatially-weighted-pooling-for","paper_date":"2017-04-04","arxiv_id":null,"code_links":[{"title":"duongttr/SWP","url":"https://github.com/duongttr/SWP"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-con-text","slug":"fine-grained-image-classification-on-con-text","dataset":"Con-Text","dataset_url":null,"rows_in_archive":1,"metrics":["mAP"],"first_row_in_archive_order":{"model":"PHOC descriptor + Fisher Vector Encoding","paper_title":"Fine-grained Image Classification and Retrieval by Combining Visual and Locally Pooled Textual Features","paper_url":"/paper/fine-grained-image-classification-and","paper_date":"2020-01-14","arxiv_id":"2001.04732","code_links":[{"title":"DreadPiratePsyopus/Fine_Grained_Clf","url":"https://github.com/DreadPiratePsyopus/Fine_Grained_Clf"},{"title":"AndresPMD/Fine_Grained_Clf","url":"https://github.com/AndresPMD/Fine_Grained_Clf"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-dib-10k","slug":"fine-grained-image-classification-on-dib-10k","dataset":"DIB-10K","dataset_url":"/dataset/dib-10k","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"MetaFGNet","paper_title":"Fine-Grained Visual Categorization using Meta-Learning Optimization with Sample Selection of Auxiliary Data","paper_url":"/paper/fine-grained-visual-categorization-using-meta","paper_date":"2018-07-28","arxiv_id":"1807.10916","code_links":[{"title":"YBZh/MetaFGNet","url":"https://github.com/YBZh/MetaFGNet"},{"title":"YabinZhang1994/MetaFGNet","url":"https://github.com/YabinZhang1994/MetaFGNet"}],"syntology":{"n":10,"n_ran":1,"n_unverified":9,"n_pointer_only":0}}},{"leaderboard":"/sota/fine-grained-image-classification-on-emnist","slug":"fine-grained-image-classification-on-emnist","dataset":"EMNIST-Digits","dataset_url":"/dataset/emnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VGG-5","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-emnist-1","slug":"fine-grained-image-classification-on-emnist-1","dataset":"EMNIST-Letters","dataset_url":"/dataset/emnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VGG-5","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-fgvc-2","slug":"fine-grained-image-classification-on-fgvc-2","dataset":"FGVC-Aircraft","dataset_url":"/dataset/fgvc-aircraft-1","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"EnGraf-Net101 (G=4, H=1)","paper_title":"EnGraf-Net: Multiple Granularity Branch Network with Fine-Coarse Graft Grained for Classification Task","paper_url":"/paper/engraf-net-multiple-granularity-branch","paper_date":"2021-10-21","arxiv_id":null,"code_links":[{"title":"artelabsuper/engraf-net","url":"https://gitlab.com/artelabsuper/engraf-net"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-mnist","slug":"fine-grained-image-classification-on-mnist","dataset":"MNIST","dataset_url":"/dataset/mnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Vanilla FC layer only","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-qmnist","slug":"fine-grained-image-classification-on-qmnist","dataset":"QMNIST","dataset_url":"/dataset/qmnist","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"VGG-5","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-classification-on-sop","slug":"fine-grained-image-classification-on-sop","dataset":"SOP","dataset_url":"/dataset/stanford-online-products","rows_in_archive":1,"metrics":["Recall@1"],"first_row_in_archive_order":{"model":"Assemble-ResNet-FGVC-50","paper_title":"Compounding the Performance Improvements of Assembled Techniques in a Convolutional Neural Network","paper_url":"/paper/compounding-the-performance-improvements-of","paper_date":"2020-01-17","arxiv_id":"2001.06268","code_links":[{"title":"clovaai/assembled-cnn","url":"https://github.com/clovaai/assembled-cnn"}],"syntology":{"n":11,"n_ran":1,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/fine-grained-image-classification-on-stl-10","slug":"fine-grained-image-classification-on-stl-10","dataset":"STL-10","dataset_url":"/dataset/stl-10","rows_in_archive":1,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"Pre trained wide-resnet-101","paper_title":"ProgressiveSpinalNet architecture for FC layers","paper_url":"/paper/progressivespinalnet-architecture-for-fc","paper_date":"2021-03-21","arxiv_id":"2103.11373","code_links":[{"title":"praveenchopra/ProgressiveSpinalNet","url":"https://github.com/praveenchopra/ProgressiveSpinalNet"}],"syntology":null}}],"datasets":[{"url":"/dataset/mnist","name":"MNIST","full_name":"","num_papers_in_archive":7651},{"url":"/dataset/cub-200-2011","name":"CUB-200-2011","full_name":"Caltech-UCSD Birds-200-2011","num_papers_in_archive":2235},{"url":"/dataset/oxford-102-flower","name":"Oxford 102 Flower","full_name":"102 Category Flower Dataset","num_papers_in_archive":1307},{"url":"/dataset/stl-10","name":"STL-10","full_name":"Self-Taught Learning 10","num_papers_in_archive":1092},{"url":"/dataset/food-101","name":"Food-101","full_name":"","num_papers_in_archive":805},{"url":"/dataset/stanford-cars","name":"Stanford Cars","full_name":"","num_papers_in_archive":790},{"url":"/dataset/caltech-101","name":"Caltech-101","full_name":"","num_papers_in_archive":709},{"url":"/dataset/inaturalist","name":"iNaturalist","full_name":"","num_papers_in_archive":603},{"url":"/dataset/fgvc-aircraft-1","name":"FGVC-Aircraft","full_name":"","num_papers_in_archive":520},{"url":"/dataset/emnist","name":"EMNIST","full_name":"Extended MNIST","num_papers_in_archive":264},{"url":"/dataset/stanford-online-products","name":"Stanford Online Products","full_name":"Stanford Online Products","num_papers_in_archive":231},{"url":"/dataset/nabirds","name":"NABirds","full_name":"North America Birds","num_papers_in_archive":143},{"url":"/dataset/kuzushiji-mnist","name":"Kuzushiji-MNIST","full_name":"","num_papers_in_archive":97},{"url":"/dataset/oxford-iiit-pets","name":"Oxford-IIIT Pet Dataset","full_name":"Oxford-IIIT Pet Dataset","num_papers_in_archive":90},{"url":"/dataset/birdsnap","name":"Birdsnap","full_name":"","num_papers_in_archive":72},{"url":"/dataset/compcars","name":"CompCars","full_name":"Comprehensive Cars","num_papers_in_archive":70},{"url":"/dataset/oxford-iiit-pets-1","name":"Oxford-IIIT Pets","full_name":"","num_papers_in_archive":59},{"url":"/dataset/stanford-dogs","name":"Stanford Dogs","full_name":"Stanford Dogs","num_papers_in_archive":57},{"url":"/dataset/sun397","name":"SUN397","full_name":"SUN397","num_papers_in_archive":52},{"url":"/dataset/qmnist","name":"QMNIST","full_name":null,"num_papers_in_archive":26},{"url":"/dataset/ip102","name":"IP102","full_name":"","num_papers_in_archive":22},{"url":"/dataset/foodx-251","name":"FoodX-251","full_name":"","num_papers_in_archive":11},{"url":"/dataset/cropandweed-dataset","name":"CropAndWeed","full_name":"","num_papers_in_archive":10},{"url":"/dataset/webfg-496","name":"WebFG-496","full_name":"","num_papers_in_archive":7},{"url":"/dataset/bird","name":"BIRD","full_name":"Blocksworld Image Reasoning Dataset","num_papers_in_archive":5},{"url":"/dataset/aircraft-context-dataset","name":"Aircraft Context Dataset","full_name":"","num_papers_in_archive":3},{"url":"/dataset/rp2k","name":"RP2K","full_name":"","num_papers_in_archive":3},{"url":"/dataset/dib-10k","name":"DIB-10K","full_name":"DongNiao International Birds 10000","num_papers_in_archive":2},{"url":"/dataset/herbarium-2021-half-earth","name":"Herbarium 2021 Half–Earth","full_name":"","num_papers_in_archive":2},{"url":"/dataset/lymphomnist","name":"LymphoMNIST","full_name":"LymphoMNIST","num_papers_in_archive":2},{"url":"/dataset/apron-dataset","name":"Apron Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/cinat-birds-2021","name":"CiNAT-Birds-2021","full_name":"Cross-View iNaturalist Birds 2021","num_papers_in_archive":1},{"url":"/dataset/fgscm-52","name":"FGSCM-52","full_name":"","num_papers_in_archive":1},{"url":"/dataset/herbarium-2022","name":"Herbarium 2022","full_name":"Identify plant species of the Americas from herbarium specimens","num_papers_in_archive":1},{"url":"/dataset/inaturalist-fine-grained-geolocation","name":"iNaturalist Fine-Grained Geolocation","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/orchid2024","name":"Orchid2024","full_name":"","num_papers_in_archive":1},{"url":"/dataset/spot-10","name":"SPOT-10","full_name":"Animal Pattern Benchmark Dataset for Machine Learning Algorithms","num_papers_in_archive":1},{"url":"/dataset/tsinghua-dogs","name":"Tsinghua Dogs","full_name":"","num_papers_in_archive":1},{"url":"/dataset/wikichurches","name":"WikiChurches","full_name":"","num_papers_in_archive":1},{"url":"/dataset/yfcc100m-fine-grained-geolocation","name":"YFCC100M Fine-Grained Geolocation","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/corn-seeds-dataset","name":"Corn Seeds Dataset","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/displaced-people-recognition","name":"Displaced People Recognition"}],"parent_tasks":[{"url":"/task/image-classification","name":"Image Classification"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":200,"tagged_in_all":353,"items":[{"url":"/paper/efficientnet-rethinking-model-scaling-for","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","date":"2019-05-28","arxiv_id":"1905.11946","repositories_listed":144,"syntology":{"n":302,"n_ran":171,"n_unverified":131,"n_pointer_only":112}},{"url":"/paper/training-data-efficient-image-transformers","title":"Training data-efficient image transformers & distillation through attention","date":"2020-12-23","arxiv_id":"2012.12877","repositories_listed":40,"syntology":{"n":19,"n_ran":12,"n_unverified":7,"n_pointer_only":3}},{"url":"/paper/autoaugment-learning-augmentation-policies","title":"AutoAugment: Learning Augmentation Policies from Data","date":"2018-05-24","arxiv_id":"1805.09501","repositories_listed":33,"syntology":{"n":43,"n_ran":6,"n_unverified":37,"n_pointer_only":2}},{"url":"/paper/dinov2-learning-robust-visual-features","title":"DINOv2: Learning Robust Visual Features without Supervision","date":"2023-04-14","arxiv_id":"2304.07193","repositories_listed":26,"syntology":{"n":46,"n_ran":21,"n_unverified":25,"n_pointer_only":12}},{"url":"/paper/resmlp-feedforward-networks-for-image","title":"ResMLP: Feedforward networks for image classification with data-efficient training","date":"2021-05-07","arxiv_id":"2105.03404","repositories_listed":19,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/sharpness-aware-minimization-for-efficiently-1","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","date":"2020-10-03","arxiv_id":"2010.01412","repositories_listed":18,"syntology":{"n":20,"n_ran":8,"n_unverified":12,"n_pointer_only":6}},{"url":"/paper/resnet-strikes-back-an-improved-training","title":"ResNet strikes back: An improved training procedure in timm","date":"2021-10-01","arxiv_id":"2110.00476","repositories_listed":14,"syntology":{"n":3,"n_ran":0,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/gpipe-efficient-training-of-giant-neural","title":"GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism","date":"2018-11-16","arxiv_id":"1811.06965","repositories_listed":13,"syntology":{"n":25,"n_ran":1,"n_unverified":24,"n_pointer_only":16}},{"url":"/paper/transformer-in-transformer","title":"Transformer in Transformer","date":"2021-02-27","arxiv_id":"2103.00112","repositories_listed":12,"syntology":{"n":24,"n_ran":16,"n_unverified":8,"n_pointer_only":5}},{"url":"/paper/learning-to-navigate-for-fine-grained","title":"Learning to Navigate for Fine-grained Classification","date":"2018-09-02","arxiv_id":"1809.00287","repositories_listed":12,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/escaping-the-big-data-paradigm-with-compact","title":"Escaping the Big Data Paradigm with Compact Transformers","date":"2021-04-12","arxiv_id":"2104.05704","repositories_listed":9,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/large-scale-learning-of-general-visual","title":"Big Transfer (BiT): General Visual Representation Learning","date":"2019-12-24","arxiv_id":"1912.11370","repositories_listed":9,"syntology":{"n":10,"n_ran":3,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/three-things-everyone-should-know-about","title":"Three things everyone should know about Vision Transformers","date":"2022-03-18","arxiv_id":"2203.09795","repositories_listed":8,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/gradient-centralization-a-new-optimization","title":"Gradient Centralization: A New Optimization Technique for Deep Neural Networks","date":"2020-04-03","arxiv_id":"2004.01461","repositories_listed":8,"syntology":{"n":29,"n_ran":2,"n_unverified":27,"n_pointer_only":1}},{"url":"/paper/unlabeled-samples-generated-by-gan-improve","title":"Unlabeled Samples Generated by GAN Improve the Person Re-identification Baseline in vitro","date":"2017-01-26","arxiv_id":"1701.07717","repositories_listed":8,"syntology":null},{"url":"/paper/three-branch-and-mutil-scale-learning-for","title":"Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization","date":"2020-03-20","arxiv_id":"2003.09150","repositories_listed":6,"syntology":null},{"url":"/paper/imagenet-21k-pretraining-for-the-masses","title":"ImageNet-21K Pretraining for the Masses","date":"2021-04-22","arxiv_id":"2104.10972","repositories_listed":5,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/scaling-up-visual-and-vision-language","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","date":"2021-02-11","arxiv_id":"2102.05918","repositories_listed":5,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":9}},{"url":"/paper/fine-grained-visual-classification-via","title":"Fine-Grained Visual Classification via Progressive Multi-Granularity Training of Jigsaw Patches","date":"2020-03-08","arxiv_id":"2003.03836","repositories_listed":5,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/your-diffusion-model-is-secretly-a-zero-shot","title":"Your Diffusion Model is Secretly a Zero-Shot Classifier","date":"2023-03-28","arxiv_id":"2303.16203","repositories_listed":4,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/with-a-little-help-from-my-friends-nearest","title":"With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations","date":"2021-04-29","arxiv_id":"2104.14548","repositories_listed":4,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/presence-only-geographical-priors-for-fine","title":"Presence-Only Geographical Priors for Fine-Grained Image Classification","date":"2019-06-12","arxiv_id":"1906.05272","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/see-better-before-looking-closer-weakly","title":"See Better Before Looking Closer: Weakly Supervised Data Augmentation Network for Fine-Grained Visual Classification","date":"2019-01-26","arxiv_id":"1901.09891","repositories_listed":4,"syntology":null},{"url":"/paper/towards-faster-training-of-global-covariance","title":"Towards Faster Training of Global Covariance Pooling Networks by Iterative Matrix Square Root Normalization","date":"2017-12-04","arxiv_id":"1712.01034","repositories_listed":4,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/bilinear-cnns-for-fine-grained-visual","title":"Bilinear CNNs for Fine-grained Visual Recognition","date":"2015-04-29","arxiv_id":"1504.07889","repositories_listed":4,"syntology":null},{"url":"/paper/densenets-reloaded-paradigm-shift-beyond","title":"DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTs","date":"2024-03-28","arxiv_id":"2403.19588","repositories_listed":3,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/spinalnet-deep-neural-network-with-gradual-1","title":"SpinalNet: Deep Neural Network with Gradual Input","date":"2020-07-07","arxiv_id":"2007.03347","repositories_listed":3,"syntology":null},{"url":"/paper/proxy-anchor-loss-for-deep-metric-learning","title":"Proxy Anchor Loss for Deep Metric Learning","date":"2020-03-31","arxiv_id":"2003.13911","repositories_listed":3,"syntology":null},{"url":"/paper/tresnet-high-performance-gpu-dedicated","title":"TResNet: High Performance GPU-Dedicated Architecture","date":"2020-03-30","arxiv_id":"2003.13630","repositories_listed":3,"syntology":null},{"url":"/paper/the-devil-is-in-the-channels-mutual-channel","title":"The Devil is in the Channels: Mutual-Channel Loss for Fine-Grained Image Classification","date":"2020-02-11","arxiv_id":"2002.04264","repositories_listed":3,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":0}}],"syntology_records":23,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}