{"url":"/task/fine-grained-image-recognition","name":"Fine-Grained Image Recognition","slug":"fine-grained-image-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":72,"papers_with_code":39,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":12,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/fine-grained-image-recognition-on-oven","slug":"fine-grained-image-recognition-on-oven","dataset":"OVEN","dataset_url":"/dataset/oven","rows_in_archive":5,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PaLI-X","paper_title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","paper_url":"/paper/pali-x-on-scaling-up-a-multilingual-vision","paper_date":"2023-05-29","arxiv_id":"2305.18565","code_links":[{"title":"kyegomez/PALI","url":"https://github.com/kyegomez/PALI"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"}],"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/fine-grained-image-recognition-on-cnfood-241","slug":"fine-grained-image-recognition-on-cnfood-241","dataset":"CNFOOD-241-Chen","dataset_url":"/dataset/cnfood-241-chen","rows_in_archive":2,"metrics":["Top-1 accuracy"],"first_row_in_archive_order":{"model":"Res-VMamba-S","paper_title":"Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning","paper_url":"/paper/res-vmamba-fine-grained-food-category-visual","paper_date":"2024-02-24","arxiv_id":"2402.15761","code_links":[{"title":"chishengchen/resvmamba","url":"https://github.com/chishengchen/resvmamba"}],"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}}},{"leaderboard":"/sota/fine-grained-image-recognition-on-cub-200","slug":"fine-grained-image-recognition-on-cub-200","dataset":"CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":2,"metrics":["Accuracy"],"first_row_in_archive_order":{"model":"PIM","paper_title":"A Novel Plug-in Module for Fine-Grained Visual Classification","paper_url":"/paper/a-novel-plug-in-module-for-fine-grained-1","paper_date":"2022-02-08","arxiv_id":"2202.03822","code_links":[{"title":"chou141253/fgvc-pim","url":"https://github.com/chou141253/fgvc-pim"}],"syntology":null}},{"leaderboard":"/sota/fine-grained-image-recognition-on-cub-birds","slug":"fine-grained-image-recognition-on-cub-birds","dataset":"CUB Birds","dataset_url":"/dataset/cub-200-2011","rows_in_archive":2,"metrics":["1:1 Accuracy"],"first_row_in_archive_order":{"model":"HOI-Net","paper_title":"High-Order-Interaction for weakly supervised Fine-Grained Visual Categorization","paper_url":"/paper/high-order-interaction-for-weakly-supervised","paper_date":"2021-11-13","arxiv_id":null,"code_links":[{"title":"puallee/HOI-Net","url":"https://github.com/puallee/HOI-Net"}],"syntology":null}}],"datasets":[{"url":"/dataset/cub-200-2011","name":"CUB-200-2011","full_name":"Caltech-UCSD Birds-200-2011","num_papers_in_archive":2235},{"url":"/dataset/omnibenchmark","name":"OmniBenchmark","full_name":"","num_papers_in_archive":29},{"url":"/dataset/oven","name":"OVEN","full_name":"Open-domain Visual Entity Recognition","num_papers_in_archive":19},{"url":"/dataset/webfg-496","name":"WebFG-496","full_name":"","num_papers_in_archive":7},{"url":"/dataset/cub-gha","name":"CUB-GHA","full_name":"CUB Gaze-based Human Attention","num_papers_in_archive":4},{"url":"/dataset/goldfinch","name":"Goldfinch","full_name":"GOogLe image-search Dataset","num_papers_in_archive":3},{"url":"/dataset/daplankton","name":"DAPlankton","full_name":"","num_papers_in_archive":2},{"url":"/dataset/ultra-fine-grained-leaves-cotton-soyageing","name":"Ultra Fine-Grained Leaves (Cotton, SoyAgeing, SoyGene, SoyGlobal, SoyLocal)","full_name":"","num_papers_in_archive":2},{"url":"/dataset/cnfood-241-chen","name":"CNFOOD-241-Chen","full_name":"CNFOOD-241-Chen","num_papers_in_archive":1},{"url":"/dataset/crowd-activity-dataset","name":"Crowd Activity Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/fruit-salad","name":"fruit-SALAD","full_name":"","num_papers_in_archive":1},{"url":"/dataset/wikichurches","name":"WikiChurches","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/image-recognition","name":"Image Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":39,"tagged_in_all":72,"items":[{"url":"/paper/three-branch-and-mutil-scale-learning-for","title":"Multi-branch and Multi-scale Attention Learning for Fine-Grained Visual Categorization","date":"2020-03-20","arxiv_id":"2003.09150","repositories_listed":6,"syntology":null},{"url":"/paper/towards-faster-training-of-global-covariance","title":"Towards Faster Training of Global Covariance Pooling Networks by Iterative Matrix Square Root Normalization","date":"2017-12-04","arxiv_id":"1712.01034","repositories_listed":4,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/learning-multi-attention-convolutional-neural","title":"Learning Multi-Attention Convolutional Neural Network for Fine-Grained Image Recognition","date":"2017-10-01","arxiv_id":null,"repositories_listed":3,"syntology":null},{"url":"/paper/hawkeye-a-pytorch-based-library-for-fine","title":"Hawkeye: A PyTorch-based Library for Fine-Grained Image Recognition with Deep Learning","date":"2023-10-14","arxiv_id":"2310.09600","repositories_listed":2,"syntology":null},{"url":"/paper/pali-x-on-scaling-up-a-multilingual-vision","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","date":"2023-05-29","arxiv_id":"2305.18565","repositories_listed":2,"syntology":{"n":7,"n_ran":6,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/open-domain-visual-entity-recognition-towards","title":"Open-domain Visual Entity Recognition: Towards Recognizing Millions of Wikipedia Entities","date":"2023-02-22","arxiv_id":"2302.11154","repositories_listed":2,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/patch-autoaugment","title":"Local Patch AutoAugment with Multi-Agent Collaboration","date":"2021-03-20","arxiv_id":"2103.11099","repositories_listed":2,"syntology":null},{"url":"/paper/destruction-and-construction-learning-for","title":"Destruction and Construction Learning for Fine-Grained Image Recognition","date":"2019-06-01","arxiv_id":null,"repositories_listed":2,"syntology":null},{"url":"/paper/cross-layer-cache-aggregation-for-token","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","date":"2024-12-31","arxiv_id":"2501.00243","repositories_listed":1,"syntology":null},{"url":"/paper/down-sampling-inter-layer-adapter-for","title":"Down-Sampling Inter-Layer Adapter for Parameter and Computation Efficient Ultra-Fine-Grained Image Recognition","date":"2024-09-17","arxiv_id":"2409.11051","repositories_listed":1,"syntology":null},{"url":"/paper/enhancing-fine-grained-visual-recognition-in","title":"Enhancing Fine-Grained Visual Recognition in the Low-Data Regime Through Feature Magnitude Regularization","date":"2024-09-03","arxiv_id":"2409.01672","repositories_listed":1,"syntology":null},{"url":"/paper/global-local-similarity-for-efficient-fine","title":"Global-Local Similarity for Efficient Fine-Grained Image Recognition with Vision Transformers","date":"2024-07-17","arxiv_id":"2407.12891","repositories_listed":1,"syntology":null},{"url":"/paper/res-vmamba-fine-grained-food-category-visual","title":"Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning","date":"2024-02-24","arxiv_id":"2402.15761","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/fine-grained-recognition-with-learnable","title":"Fine-grained Recognition with Learnable Semantic Data Augmentation","date":"2023-09-01","arxiv_id":"2309.00399","repositories_listed":1,"syntology":{"n":7,"n_ran":3,"n_unverified":4,"n_pointer_only":7}},{"url":"/paper/ppl-pairwise-prototype-learning-for-masked","title":"PPL: Pairwise Prototype Learning for Masked Face Recognition","date":"2022-11-21","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/taxonomy-and-evolution-predicting-using-deep","title":"Taxonomy and evolution predicting using deep learning in images","date":"2022-06-28","arxiv_id":"2206.14011","repositories_listed":1,"syntology":null},{"url":"/paper/making-heads-or-tails-towards-semantically","title":"Making Heads or Tails: Towards Semantically Consistent Visual Counterfactuals","date":"2022-03-24","arxiv_id":"2203.12892","repositories_listed":1,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":4}},{"url":"/paper/a-novel-plug-in-module-for-fine-grained-1","title":"A Novel Plug-in Module for Fine-Grained Visual Classification","date":"2022-02-08","arxiv_id":"2202.03822","repositories_listed":1,"syntology":null},{"url":"/paper/high-order-interaction-for-weakly-supervised","title":"High-Order-Interaction for weakly supervised Fine-Grained Visual Categorization","date":"2021-11-13","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/the-curious-layperson-fine-grained-image","title":"The Curious Layperson: Fine-Grained Image Recognition without Expert Labels","date":"2021-11-05","arxiv_id":"2111.03651","repositories_listed":1,"syntology":null},{"url":"/paper/attend-and-guide-ag-net-a-keypoints-driven","title":"Attend and Guide (AG-Net): A Keypoints-driven Attention-based Deep Network for Image Recognition","date":"2021-10-23","arxiv_id":"2110.12183","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-hand-gesture-recognition-in","title":"Fine-grained Hand Gesture Recognition in Multi-viewpoint Hand Hygiene","date":"2021-09-07","arxiv_id":"2109.02917","repositories_listed":1,"syntology":null},{"url":"/paper/counterfactual-attention-learning-for-fine","title":"Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-identification","date":"2021-08-19","arxiv_id":"2108.08728","repositories_listed":1,"syntology":{"n":11,"n_ran":8,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/align-yourself-self-supervised-pre-training","title":"Exploring Localization for Self-supervised Fine-grained Contrastive Learning","date":"2021-06-30","arxiv_id":"2106.15788","repositories_listed":1,"syntology":null},{"url":"/paper/danish-fungi-2020-not-just-another-image","title":"Danish Fungi 2020 -- Not Just Another Image Recognition Dataset","date":"2021-03-18","arxiv_id":"2103.10107","repositories_listed":1,"syntology":null},{"url":"/paper/neural-prototype-trees-for-interpretable-fine","title":"Neural Prototype Trees for Interpretable Fine-grained Image Recognition","date":"2020-12-03","arxiv_id":"2012.02046","repositories_listed":1,"syntology":null},{"url":"/paper/how-well-do-self-supervised-models-transfer","title":"How Well Do Self-Supervised Models Transfer?","date":"2020-11-26","arxiv_id":"2011.13377","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/contrastively-reinforced-attention","title":"Contrastively-reinforced Attention Convolutional Neural Network for Fine-grained Image Recognition","date":"2020-09-08","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/semi-supervised-recognition-under-a-noisy-and","title":"Semi-Supervised Recognition under a Noisy and Fine-grained Dataset","date":"2020-06-18","arxiv_id":"2006.10702","repositories_listed":1,"syntology":null},{"url":"/paper/epillid-dataset-a-low-shot-fine-grained","title":"ePillID Dataset: A Low-Shot Fine-Grained Benchmark for Pill Identification","date":"2020-05-28","arxiv_id":"2005.14288","repositories_listed":1,"syntology":null}],"syntology_records":8,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}