{"url":"/task/fine-grained-visual-recognition","name":"Fine-Grained Visual Recognition","slug":"fine-grained-visual-recognition","description_markdown":null,"categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":72,"papers_with_code":43,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":9,"subtasks":0,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/fine-grained-visual-recognition-on-cub-200-1","slug":"fine-grained-visual-recognition-on-cub-200-1","dataset":"CUB-200-2011","dataset_url":"/dataset/cub-200-2011","rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Selfsynthx","paper_title":"Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data","paper_url":"/paper/enhancing-cognition-and-explainability-of","paper_date":"2025-02-19","arxiv_id":"2502.14044","code_links":[{"title":"sycny/selfsynthx","url":"https://github.com/sycny/selfsynthx"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/fine-grained-visual-recognition-on-fgvc-2","slug":"fine-grained-visual-recognition-on-fgvc-2","dataset":"FGVC-Aircraft","dataset_url":"/dataset/fgvc-aircraft-1","rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Selfsynthx","paper_title":"Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data","paper_url":"/paper/enhancing-cognition-and-explainability-of","paper_date":"2025-02-19","arxiv_id":"2502.14044","code_links":[{"title":"sycny/selfsynthx","url":"https://github.com/sycny/selfsynthx"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/fine-grained-visual-recognition-on-new-plant","slug":"fine-grained-visual-recognition-on-new-plant","dataset":"New Plant Diseases Dataset","dataset_url":"/dataset/new-plant-diseases-dataset","rows_in_archive":1,"metrics":["Accuracy (% )"],"first_row_in_archive_order":{"model":"Selfsynthx","paper_title":"Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data","paper_url":"/paper/enhancing-cognition-and-explainability-of","paper_date":"2025-02-19","arxiv_id":"2502.14044","code_links":[{"title":"sycny/selfsynthx","url":"https://github.com/sycny/selfsynthx"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}}},{"leaderboard":"/sota/fine-grained-visual-recognition-on-stanford-2","slug":"fine-grained-visual-recognition-on-stanford-2","dataset":"Stanford Dogs","dataset_url":"/dataset/stanford-dogs","rows_in_archive":1,"metrics":["Accuracy (%)"],"first_row_in_archive_order":{"model":"Selfsynthx","paper_title":"Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data","paper_url":"/paper/enhancing-cognition-and-explainability-of","paper_date":"2025-02-19","arxiv_id":"2502.14044","code_links":[{"title":"sycny/selfsynthx","url":"https://github.com/sycny/selfsynthx"}],"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}}}],"datasets":[{"url":"/dataset/cub-200-2011","name":"CUB-200-2011","full_name":"Caltech-UCSD Birds-200-2011","num_papers_in_archive":2235},{"url":"/dataset/fgvc-aircraft-1","name":"FGVC-Aircraft","full_name":"","num_papers_in_archive":520},{"url":"/dataset/stanford-dogs","name":"Stanford Dogs","full_name":"Stanford Dogs","num_papers_in_archive":57},{"url":"/dataset/mtl-aqa","name":"MTL-AQA","full_name":"","num_papers_in_archive":33},{"url":"/dataset/webfg-496","name":"WebFG-496","full_name":"","num_papers_in_archive":7},{"url":"/dataset/whoi-plankton","name":"WHOI-Plankton","full_name":"","num_papers_in_archive":6},{"url":"/dataset/new-plant-diseases-dataset","name":"New Plant Diseases Dataset","full_name":"Image dataset containing different healthy and unhealthy crop leaves.","num_papers_in_archive":2},{"url":"/dataset/feathersv1","name":"FeathersV1","full_name":null,"num_papers_in_archive":1},{"url":"/dataset/wikichurches","name":"WikiChurches","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[{"url":"/task/visual-recognition","name":"Visual Recognition"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":43,"tagged_in_all":72,"items":[{"url":"/paper/fashionpedia-ontology-segmentation-and-an","title":"Fashionpedia: Ontology, Segmentation, and an Attribute Localization Dataset","date":"2020-04-26","arxiv_id":"2004.12276","repositories_listed":8,"syntology":null},{"url":"/paper/bilinear-cnns-for-fine-grained-visual","title":"Bilinear CNNs for Fine-grained Visual Recognition","date":"2015-04-29","arxiv_id":"1504.07889","repositories_listed":4,"syntology":null},{"url":"/paper/deep-cnns-meet-global-covariance-pooling","title":"Deep CNNs Meet Global Covariance Pooling: Better Representation and Generalization","date":"2019-04-15","arxiv_id":"1904.06836","repositories_listed":3,"syntology":{"n":5,"n_ran":3,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/retrieving-similar-e-commerce-images-using","title":"Retrieving Similar E-Commerce Images Using Deep Learning","date":"2019-01-11","arxiv_id":"1901.03546","repositories_listed":3,"syntology":null},{"url":"/paper/rar-retrieving-and-ranking-augmented-mllms","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","date":"2024-03-20","arxiv_id":"2403.13805","repositories_listed":2,"syntology":{"n":7,"n_ran":5,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/clip-art-contrastive-pre-training-for-fine-1","title":"CLIP-Art: Contrastive Pre-training for Fine-Grained Art Classification","date":"2022-04-29","arxiv_id":"2204.14244","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/feathers-dataset-for-fine-grained-visual","title":"Feathers dataset for Fine-Grained Visual Categorization","date":"2020-04-18","arxiv_id":"2004.08606","repositories_listed":2,"syntology":null},{"url":"/paper/x-linear-attention-networks-for-image","title":"X-Linear Attention Networks for Image Captioning","date":"2020-03-31","arxiv_id":"2003.14080","repositories_listed":2,"syntology":null},{"url":"/paper/mildnet-a-lightweight-single-scaled-deep","title":"MILDNet: A Lightweight Single Scaled Deep Ranking Architecture","date":"2019-03-03","arxiv_id":"1903.00905","repositories_listed":2,"syntology":null},{"url":"/paper/hierarchical-bilinear-pooling-for-fine","title":"Hierarchical Bilinear Pooling for Fine-Grained Visual Recognition","date":"2018-07-26","arxiv_id":"1807.09915","repositories_listed":2,"syntology":null},{"url":"/paper/metric-learning-with-adaptive-density","title":"Metric Learning with Adaptive Density Discrimination","date":"2015-11-18","arxiv_id":"1511.05939","repositories_listed":2,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/enhancing-cognition-and-explainability-of","title":"Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data","date":"2025-02-19","arxiv_id":"2502.14044","repositories_listed":1,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/analyzing-and-boosting-the-power-of-fine","title":"Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models","date":"2025-01-25","arxiv_id":"2501.15140","repositories_listed":1,"syntology":{"n":6,"n_ran":4,"n_unverified":2,"n_pointer_only":6}},{"url":"/paper/interweaving-insights-high-order-feature","title":"Interweaving Insights: High-Order Feature Interaction for Fine-Grained Visual Recognition","date":"2024-10-20","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/enhancing-fine-grained-visual-recognition-in","title":"Enhancing Fine-Grained Visual Recognition in the Low-Data Regime Through Feature Magnitude Regularization","date":"2024-09-03","arxiv_id":"2409.01672","repositories_listed":1,"syntology":null},{"url":"/paper/towards-generative-class-prompt-learning-for","title":"Towards Generative Class Prompt Learning for Fine-grained Visual Recognition","date":"2024-09-03","arxiv_id":"2409.01835","repositories_listed":1,"syntology":null},{"url":"/paper/extremely-fine-grained-visual-classification","title":"Extremely Fine-Grained Visual Classification over Resembling Glyphs in the Wild","date":"2024-08-25","arxiv_id":"2408.13774","repositories_listed":1,"syntology":null},{"url":"/paper/extract-more-from-less-efficient-fine-grained","title":"Extract More from Less: Efficient Fine-Grained Visual Recognition in Low-Data Regimes","date":"2024-06-28","arxiv_id":"2406.19814","repositories_listed":1,"syntology":null},{"url":"/paper/few-shot-classification-of-interactive","title":"Few-Shot Classification of Interactive Activities of Daily Living (InteractADL)","date":"2024-06-03","arxiv_id":"2406.01662","repositories_listed":1,"syntology":null},{"url":"/paper/hgclip-exploring-vision-language-models-with-1","title":"HGCLIP: Exploring Vision-Language Models with Graph Representations for Hierarchical Understanding","date":"2023-11-23","arxiv_id":"2311.14064","repositories_listed":1,"syntology":{"n":6,"n_ran":3,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/dynamic-conceptional-contrastive-learning-for","title":"Dynamic Conceptional Contrastive Learning for Generalized Category Discovery","date":"2023-03-30","arxiv_id":"2303.17393","repositories_listed":1,"syntology":null},{"url":"/paper/learning-common-rationale-to-improve-self","title":"Learning Common Rationale to Improve Self-Supervised Representation for Fine-Grained Visual Recognition Problems","date":"2023-03-03","arxiv_id":"2303.01669","repositories_listed":1,"syntology":null},{"url":"/paper/fine-grained-visual-classification-via-2","title":"Fine-Grained Visual Classification via Internal Ensemble Learning Transformer","date":"2023-02-13","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/multi-view-active-fine-grained-visual","title":"Multi-View Active Fine-Grained Visual Recognition","date":"2023-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/part-guided-relational-transformers-for-fine","title":"Part-guided Relational Transformers for Fine-grained Visual Recognition","date":"2022-12-28","arxiv_id":"2212.13685","repositories_listed":1,"syntology":null},{"url":"/paper/penalizing-the-hard-example-but-not-too-much","title":"Penalizing the Hard Example But Not Too Much: A Strong Baseline for Fine-Grained Visual Classification","date":"2022-11-21","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/improving-fine-grained-visual-recognition-in","title":"Improving Fine-Grained Visual Recognition in Low Data Regimes via Self-Boosting Attention Mechanism","date":"2022-08-01","arxiv_id":"2208.00617","repositories_listed":1,"syntology":null},{"url":"/paper/memsac-memory-augmented-sample-consistency","title":"MemSAC: Memory Augmented Sample Consistency for Large Scale Unsupervised Domain Adaptation","date":"2022-07-25","arxiv_id":"2207.12389","repositories_listed":1,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/on-the-eigenvalues-of-global-covariance","title":"On the Eigenvalues of Global Covariance Pooling for Fine-grained Visual Recognition","date":"2022-05-26","arxiv_id":"2205.13282","repositories_listed":1,"syntology":{"n":17,"n_ran":3,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/do-vision-language-pretrained-models-learn","title":"Do Vision-Language Pretrained Models Learn Composable Primitive Concepts?","date":"2022-03-31","arxiv_id":"2203.17271","repositories_listed":1,"syntology":{"n":4,"n_ran":4,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":10,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}