{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/are-these-birds-similar-learning-branched","title":"Are These Birds Similar: Learning Branched Networks for Fine-grained Representations","arxiv_id":null,"date":"2020-01-16","proceeding":null,"authors":["Shah Nawaz","Alessandro Calefati","Moreno Caraffini","Nicola Landro","Ignazio Gallo"],"abstract":"Fine-grained image classification is a challenging task due to the presence of hierarchical coarse-to-fine-grained distribution in the dataset. Generally, parts are used to discriminate various objects in fine-grained datasets, however, not all parts are beneficial and indispensable. In recent years, natural language descriptions are used to obtain information on discriminative parts of the object. This paper leverages on natural language description and proposes a strategy for learning the joint representation of natural language description and images using a two-branch network with multiple layers to improve the fine-grained classification task. Extensive experiments show that our approach gains significant improvements in accuracy for the fine-grained image classification task. Furthermore, our method achieves new state-of-the-art results on the CUB-200-2011 dataset.","url_abs":"https://ieeexplore.ieee.org/document/8960960","url_pdf":"http://artelab.dista.uninsubria.it/res/research/papers/2019/2019-IVCNZ-Nawaz-Birds.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"are-these-birds-similar-learning-branched","repo_url":"https://github.com/Mind23-2/MindCode-101/tree/main/ntsnet","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"mindspore","reach":null},{"paper_slug":"are-these-birds-similar-learning-branched","repo_url":"https://github.com/nicolalandro/ntsnet-cub200","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"are-these-birds-similar-learning-branched","repo_url":"https://gitlab.com/artelabsuper/ivcnz-2019-bird","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"document-text-classification","task_name":"Document Text Classification"},{"task_slug":"fine-grained-image-classification","task_name":"Fine-Grained Image Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"multi-modal-document-classification","task_name":"Multi-Modal Document Classification"},{"task_slug":"multimodal-deep-learning","task_name":"Multimodal Deep Learning"},{"task_slug":"multimodal-text-and-image-classification","task_name":"Multimodal Text and Image Classification"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/document-text-classification-on-cub-200-2011","task":"Document Text Classification","dataset":"CUB-200-2011","model":"Bert","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"65.0"},"uses_additional_data":false},{"leaderboard":"/sota/fine-grained-image-classification-on-cub-200-1","task":"Fine-Grained Image Classification","dataset":"CUB-200-2011","model":"Nts-Net","rank_in_archive_order":24,"of":30,"metrics":{"Accuracy":"87.5"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-deep-learning-on-cub-200-2011","task":"Multimodal Deep Learning","dataset":"CUB-200-2011","model":"Two Branch Network (Text - Bert + Image - Nts-Net)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"96.81"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-text-and-image-classification-on","task":"Multimodal Text and Image Classification","dataset":"CUB-200-2011","model":"Two Branch Network (Text - Bert + Image - Nts-Net)","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"96.81"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}