{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/evaluation-of-output-embeddings-for-fine","title":"Evaluation of Output Embeddings for Fine-Grained Image Classification","arxiv_id":"1409.8403","date":"2014-09-30","proceeding":"CVPR 2015 6","authors":["Zeynep Akata","Scott Reed","Daniel Walter","Honglak Lee","Bernt Schiele"],"abstract":"Image classification has advanced significantly in recent years with the\navailability of large-scale image sets. However, fine-grained classification\nremains a major challenge due to the annotation cost of large numbers of\nfine-grained categories. This project shows that compelling classification\nperformance can be achieved on such categories even without labeled training\ndata. Given image and class embeddings, we learn a compatibility function such\nthat matching embeddings are assigned a higher score than mismatching ones;\nzero-shot classification of an image proceeds by finding the label yielding the\nhighest joint compatibility score. We use state-of-the-art image features and\nfocus on different supervised attributes and unsupervised output embeddings\neither derived from hierarchies or learned from unlabeled text corpora. We\nestablish a substantially improved state-of-the-art on the Animals with\nAttributes and Caltech-UCSD Birds datasets. Most encouragingly, we demonstrate\nthat purely unsupervised output embeddings (learned from Wikipedia and improved\nwith fine-grained text) achieve compelling results, even outperforming the\nprevious supervised state-of-the-art. By combining different output embeddings,\nwe further improve results.","url_abs":"http://arxiv.org/abs/1409.8403v2","url_pdf":"http://arxiv.org/pdf/1409.8403v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"evaluation-of-output-embeddings-for-fine","repo_url":"https://github.com/inars/developing_mc_for_zsl","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"evaluation-of-output-embeddings-for-fine","repo_url":"https://github.com/mvp18/Popular-ZSL-Algorithms","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"few-shot-image-classification","task_name":"Few-Shot Image Classification"},{"task_slug":"fine-grained-image-classification","task_name":"Fine-Grained Image Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"zero-shot-action-recognition","task_name":"Zero-Shot Action Recognition"},{"task_slug":"zero-shot-learning","task_name":"Zero-Shot Learning"},{"task_slug":"image-classification","task_name":"image-classification"},{"task_slug":null,"task_name":"zero-shot-classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/few-shot-image-classification-on-cub-200-50","task":"Few-Shot Image Classification","dataset":"CUB 200 50-way (0-shot)","model":"SJE Akata et al. (2015)","rank_in_archive_order":4,"of":4,"metrics":{"Accuracy":"50.1"},"uses_additional_data":false},{"leaderboard":"/sota/few-shot-image-classification-on-cub-200-0","task":"Few-Shot Image Classification","dataset":"CUB-200 - 0-Shot Learning","model":"SJE","rank_in_archive_order":2,"of":3,"metrics":{"Accuracy":" 50.1%"},"uses_additional_data":false},{"leaderboard":"/sota/few-shot-image-classification-on-cub-200-2011-1","task":"Few-Shot Image Classification","dataset":"CUB-200-2011 - 0-Shot","model":"SJE","rank_in_archive_order":3,"of":5,"metrics":{"Top-1 Accuracy":"50.1%"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-hmdb51","task":"Zero-Shot Action Recognition","dataset":"HMDB51","model":"SJE(word embedding)","rank_in_archive_order":28,"of":29,"metrics":{"Top-1 Accuracy":"13.3"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-kinetics","task":"Zero-Shot Action Recognition","dataset":"Kinetics","model":"SJE(Word Embedding)","rank_in_archive_order":20,"of":20,"metrics":{"Top-1 Accuracy":"22.3","Top-5 Accuracy":"48.2"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-olympics","task":"Zero-Shot Action Recognition","dataset":"Olympics","model":"SJE(Atrribute)","rank_in_archive_order":6,"of":9,"metrics":{"Top-1 Accuracy":"47.5"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-olympics","task":"Zero-Shot Action Recognition","dataset":"Olympics","model":"SJE(Word Embedding)","rank_in_archive_order":9,"of":9,"metrics":{"Top-1 Accuracy":"28.6"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","task":"Zero-Shot Action Recognition","dataset":"UCF101","model":"SJE(Attribute)","rank_in_archive_order":33,"of":35,"metrics":{"Top-1 Accuracy":"12.0"},"uses_additional_data":false},{"leaderboard":"/sota/zero-shot-action-recognition-on-ucf101","task":"Zero-Shot Action Recognition","dataset":"UCF101","model":"SJE(Word Embedding)","rank_in_archive_order":35,"of":35,"metrics":{"Top-1 Accuracy":"9.9"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1409.8403","atlas_url":"https://app.syntology.ai/?focus=1409.8403","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}