{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/hpt-hierarchically-prompting-vision-language","title":"HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling","arxiv_id":"2408.14812","date":"2024-08-27","proceeding":null,"authors":["Yubin Wang","Xinyang Jiang","De Cheng","Wenli Sun","Dongsheng Li","Cairong Zhao"],"abstract":"Prompt learning has become a prevalent strategy for adapting vision-language foundation models (VLMs) such as CLIP to downstream tasks. With the emergence of large language models (LLMs), recent studies have explored the potential of using category-related descriptions to enhance prompt effectiveness. However, conventional descriptions lack explicit structured information necessary to represent the interconnections among key elements like entities or attributes with relation to a particular category. Since existing prompt tuning methods give little consideration to managing structured knowledge, this paper advocates leveraging LLMs to construct a graph for each description to prioritize such structured knowledge. Consequently, we propose a novel approach called Hierarchical Prompt Tuning (HPT), enabling simultaneous modeling of both structured and conventional linguistic knowledge. Specifically, we introduce a relationship-guided attention module to capture pair-wise associations among entities and attributes for low-level prompt learning. In addition, by incorporating high-level and global-level prompts modeling overall semantics, the proposed hierarchical structure forges cross-level interlinks and empowers the model to handle more complex and long-term relationships. Finally, by enhancing multi-granularity knowledge generation, redesigning the relationship-driven attention re-weighting module, and incorporating consistent constraints on the hierarchical text encoder, we propose HPT++, which further improves the performance of HPT. Our experiments are conducted across a wide range of evaluation settings, including base-to-new generalization, cross-dataset evaluation, and domain generalization. Extensive results and ablation studies demonstrate the effectiveness of our methods, which consistently outperform existing SOTA methods.","url_abs":"https://arxiv.org/abs/2408.14812v1","url_pdf":"https://arxiv.org/pdf/2408.14812v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"hpt-hierarchically-prompting-vision-language","repo_url":"https://github.com/ThomasWangY/2024-AAAI-HPT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"hpt-hierarchically-prompting-vision-language","repo_url":"https://github.com/vill-lab/2024-aaai-hpt","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"domain-generalization","task_name":"Domain Generalization"},{"task_slug":"prompt-engineering","task_name":"Prompt Engineering"},{"task_slug":"prompt-learning","task_name":"Prompt Learning"}],"methods":[{"method_slug":"attention","method_name":"Attention"},{"method_slug":"clip","method_name":"CLIP"},{"method_slug":"softmax","method_name":"Softmax"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/prompt-engineering-on-caltech-101","task":"Prompt Engineering","dataset":"Caltech-101","model":"HPT++","rank_in_archive_order":2,"of":14,"metrics":{"Harmonic mean":"96.96"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-dtd","task":"Prompt Engineering","dataset":"DTD","model":"HPT++","rank_in_archive_order":3,"of":14,"metrics":{"Harmonic mean":"74.23"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-eurosat","task":"Prompt Engineering","dataset":"EuroSAT","model":"HPT++","rank_in_archive_order":3,"of":14,"metrics":{"Harmonic mean":"87.36"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-fgvc-aircraft","task":"Prompt Engineering","dataset":"FGVC-Aircraft","model":"HPT++","rank_in_archive_order":3,"of":14,"metrics":{"Harmonic mean":"41.33"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-food-101","task":"Prompt Engineering","dataset":"Food-101","model":"HPT++","rank_in_archive_order":9,"of":13,"metrics":{"Harmonic mean":"91.09"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-imagenet","task":"Prompt Engineering","dataset":"ImageNet","model":"HPT++","rank_in_archive_order":6,"of":15,"metrics":{"Harmonic mean":"74.24"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-imagenet-v2","task":"Prompt Engineering","dataset":"ImageNet V2","model":"HPT++","rank_in_archive_order":1,"of":8,"metrics":{"Top-1 accuracy %":"65.31"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-imagenet-a","task":"Prompt Engineering","dataset":"ImageNet-A","model":"HPT++","rank_in_archive_order":3,"of":9,"metrics":{"Top-1 accuracy %":"51.18"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-imagenet-r","task":"Prompt Engineering","dataset":"ImageNet-R","model":"HPT++","rank_in_archive_order":4,"of":9,"metrics":{"Top-1 accuracy %":"77.52"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-imagenet-s","task":"Prompt Engineering","dataset":"ImageNet-S","model":"HPT++","rank_in_archive_order":5,"of":9,"metrics":{"Top-1 accuracy %":"49.28"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-oxford-102-flower","task":"Prompt Engineering","dataset":"Oxford 102 Flower","model":"HPT++","rank_in_archive_order":8,"of":14,"metrics":{"Harmonic mean":"85.85"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-oxford-iiit-pet-dataset","task":"Prompt Engineering","dataset":"Oxford-IIIT Pet Dataset","model":"HPT++","rank_in_archive_order":2,"of":14,"metrics":{"Harmonic mean":"96.91"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-sun397","task":"Prompt Engineering","dataset":"SUN397","model":"HPT++","rank_in_archive_order":5,"of":14,"metrics":{"Harmonic mean":"81.11"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-stanford-cars-1","task":"Prompt Engineering","dataset":"Stanford Cars","model":"HPT++","rank_in_archive_order":8,"of":14,"metrics":{"Harmonic mean":"75.59"},"uses_additional_data":false},{"leaderboard":"/sota/prompt-engineering-on-ucf101","task":"Prompt Engineering","dataset":"UCF101","model":"HPT++","rank_in_archive_order":3,"of":14,"metrics":{"Harmonic mean":"83.81"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2408.14812","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}