{"url":"/task/visual-prompt-tuning","name":"Visual Prompt Tuning","slug":"visual-prompt-tuning","description_markdown":"Visual Prompt Tuning(VPT) only introduces a small amount of task-specific learnable parameters into the input space while freezing the entire pre-trained Transformer backbone during downstream training. In practice, these additional parameters are simply prepended into the input sequence of each Transformer layer and learned together with a linear head during fine-tuning.  VPT is especially effective in the low-data regime, and maintains its advantage across data scales. Finally, VPT is competitive for a range of Transformer scales and designs (ViTBase/Large/Huge, Swin). Put together, the results suggest that VPT is one of the most effective ways of adapting ever-growing vision backbones.","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":70,"papers_with_code":37,"benchmarks":4,"benchmark_tables_in_archive":4,"benchmark_tables_shown":4,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":1,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/visual-prompt-tuning-on-fgvc","slug":"visual-prompt-tuning-on-fgvc","dataset":"FGVC","dataset_url":null,"rows_in_archive":10,"metrics":["Mean Accuracy"],"first_row_in_archive_order":{"model":"SPT-Deep(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)","paper_title":"Revisiting the Power of Prompt for Visual Tuning","paper_url":"/paper/revisiting-the-power-of-prompt-for-visual","paper_date":"2024-02-04","arxiv_id":"2402.02382","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-prompt-tuning-on-vtab-1k-natural-7","slug":"visual-prompt-tuning-on-vtab-1k-natural-7","dataset":"VTAB-1k(Natural<7>)","dataset_url":"/dataset/vtab","rows_in_archive":10,"metrics":["Mean Accuracy"],"first_row_in_archive_order":{"model":"SPT-Deep(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)","paper_title":"Revisiting the Power of Prompt for Visual Tuning","paper_url":"/paper/revisiting-the-power-of-prompt-for-visual","paper_date":"2024-02-04","arxiv_id":"2402.02382","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-prompt-tuning-on-vtab-1k-specialized-4","slug":"visual-prompt-tuning-on-vtab-1k-specialized-4","dataset":"VTAB-1k(Specialized<4>)","dataset_url":"/dataset/vtab","rows_in_archive":10,"metrics":["Mean Accuracy"],"first_row_in_archive_order":{"model":"SPT-Deep(ViT-B/16_MoCo_v3_pretrained_ImageNet-1K)","paper_title":"Revisiting the Power of Prompt for Visual Tuning","paper_url":"/paper/revisiting-the-power-of-prompt-for-visual","paper_date":"2024-02-04","arxiv_id":"2402.02382","code_links":[],"syntology":null}},{"leaderboard":"/sota/visual-prompt-tuning-on-vtab-1k-structured-8","slug":"visual-prompt-tuning-on-vtab-1k-structured-8","dataset":"VTAB-1k(Structured<8>)","dataset_url":"/dataset/vtab","rows_in_archive":10,"metrics":["Mean Accuracy"],"first_row_in_archive_order":{"model":"SPT-Deep(ViT-B/16_MAE_pretrained_ImageNet-1K)","paper_title":"Revisiting the Power of Prompt for Visual Tuning","paper_url":"/paper/revisiting-the-power-of-prompt-for-visual","paper_date":"2024-02-04","arxiv_id":"2402.02382","code_links":[],"syntology":null}}],"datasets":[{"url":"/dataset/vtab","name":"VTAB","full_name":"Visual Task Adaptation Benchmark","num_papers_in_archive":202}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":37,"tagged_in_all":70,"items":[{"url":"/paper/visual-prompt-tuning","title":"Visual Prompt Tuning","date":"2022-03-23","arxiv_id":"2203.12119","repositories_listed":6,"syntology":{"n":27,"n_ran":17,"n_unverified":10,"n_pointer_only":15}},{"url":"/paper/improving-visual-prompt-tuning-by-gaussian","title":"Improving Visual Prompt Tuning by Gaussian Neighborhood Minimization for Long-Tailed Visual Recognition","date":"2024-10-28","arxiv_id":"2410.21042","repositories_listed":3,"syntology":{"n":8,"n_ran":1,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/instance-aware-dynamic-prompt-tuning-for-pre","title":"Instance-aware Dynamic Prompt Tuning for Pre-trained Point Cloud Models","date":"2023-04-14","arxiv_id":"2304.07221","repositories_listed":3,"syntology":{"n":14,"n_ran":9,"n_unverified":5,"n_pointer_only":14}},{"url":"/paper/understanding-zero-shot-adversarial","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","date":"2022-12-14","arxiv_id":"2212.07016","repositories_listed":2,"syntology":null},{"url":"/paper/attention-to-burstiness-low-rank-bilinear","title":"Attention to Burstiness: Low-Rank Bilinear Prompt Tuning","date":"2025-06-28","arxiv_id":"2506.22908","repositories_listed":1,"syntology":null},{"url":"/paper/da-vpt-semantic-guided-visual-prompt-tuning","title":"DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers","date":"2025-05-29","arxiv_id":"2505.23694","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/q-adapt-adapting-lmm-for-visual-quality","title":"Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning","date":"2025-04-02","arxiv_id":"2504.01655","repositories_listed":1,"syntology":null},{"url":"/paper/iterative-prompt-relocation-for-distribution","title":"Iterative Prompt Relocation for Distribution-Adaptive Visual Prompt Tuning","date":"2025-03-10","arxiv_id":"2503.06901","repositories_listed":1,"syntology":null},{"url":"/paper/prompt-cam-a-simpler-interpretable","title":"Prompt-CAM: A Simpler Interpretable Transformer for Fine-Grained Analysis","date":"2025-01-16","arxiv_id":"2501.09333","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/prompt-cam-making-vision-transformers","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","date":"2025-01-01","arxiv_id":null,"repositories_listed":1,"syntology":null},{"url":"/paper/semantic-hierarchical-prompt-tuning-for","title":"Semantic Hierarchical Prompt Tuning for Parameter-Efficient Fine-Tuning","date":"2024-12-22","arxiv_id":"2412.16956","repositories_listed":1,"syntology":null},{"url":"/paper/med-persam-one-shot-visual-prompt-tuning-for","title":"Med-PerSAM: One-Shot Visual Prompt Tuning for Personalized Segment Anything Model in Medical Domain","date":"2024-11-25","arxiv_id":"2411.16123","repositories_listed":1,"syntology":null},{"url":"/paper/visual-fourier-prompt-tuning","title":"Visual Fourier Prompt Tuning","date":"2024-11-02","arxiv_id":"2411.01327","repositories_listed":1,"syntology":{"n":17,"n_ran":3,"n_unverified":14,"n_pointer_only":17}},{"url":"/paper/tunevlseg-prompt-tuning-benchmark-for-vision","title":"TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models","date":"2024-10-07","arxiv_id":"2410.05239","repositories_listed":1,"syntology":null},{"url":"/paper/cvpt-cross-attention-help-visual-prompt","title":"CVPT: Cross-Attention help Visual Prompt Tuning adapt visual task","date":"2024-08-27","arxiv_id":"2408.14961","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":6}},{"url":"/paper/discovering-long-term-effects-on-parameter","title":"SAN: Hypothesizing Long-Term Synaptic Development and Neural Engram Mechanism in Scalable Model's Parameter-Efficient Fine-Tuning","date":"2024-08-24","arxiv_id":"2409.06706","repositories_listed":1,"syntology":{"n":10,"n_ran":7,"n_unverified":3,"n_pointer_only":10}},{"url":"/paper/visual-prompt-tuning-in-null-space-for","title":"Visual Prompt Tuning in Null Space for Continual Learning","date":"2024-06-09","arxiv_id":"2406.05658","repositories_listed":1,"syntology":{"n":19,"n_ran":12,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/tai-text-as-image-for-multi-label-image","title":"TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt","date":"2024-05-11","arxiv_id":"2405.06926","repositories_listed":1,"syntology":{"n":10,"n_ran":8,"n_unverified":2,"n_pointer_only":10}},{"url":"/paper/eclipse-efficient-continual-learning-in","title":"ECLIPSE: Efficient Continual Learning in Panoptic Segmentation with Visual Prompt Tuning","date":"2024-03-29","arxiv_id":"2403.20126","repositories_listed":1,"syntology":{"n":4,"n_ran":3,"n_unverified":1,"n_pointer_only":4}},{"url":"/paper/coda-instructive-chain-of-domain-adaptation","title":"CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt Tuning","date":"2024-03-26","arxiv_id":"2403.17369","repositories_listed":1,"syntology":null},{"url":"/paper/collavo-crayon-large-language-and-vision","title":"CoLLaVO: Crayon Large Language and Vision mOdel","date":"2024-02-17","arxiv_id":"2402.11248","repositories_listed":1,"syntology":{"n":6,"n_ran":5,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/facing-the-elephant-in-the-room-visual-prompt","title":"Facing the Elephant in the Room: Visual Prompt Tuning or Full Finetuning?","date":"2024-01-23","arxiv_id":"2401.12902","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/sa-2-vp-spatially-aligned-and-adapted-visual","title":"SA$^2$VP: Spatially Aligned-and-Adapted Visual Prompt","date":"2023-12-16","arxiv_id":"2312.10376","repositories_listed":1,"syntology":{"n":14,"n_ran":10,"n_unverified":4,"n_pointer_only":4}},{"url":"/paper/tsp-transformer-task-specific-prompts-boosted","title":"TSP-Transformer: Task-Specific Prompts Boosted Transformer for Holistic Scene Understanding","date":"2023-11-06","arxiv_id":"2311.03427","repositories_listed":1,"syntology":null},{"url":"/paper/heterogeneous-federated-learning-with-group","title":"Unlocking the Potential of Prompt-Tuning in Bridging Generalized and Personalized Federated Learning","date":"2023-10-27","arxiv_id":"2310.18285","repositories_listed":1,"syntology":{"n":14,"n_ran":7,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/a-critical-look-at-classic-test-time","title":"From Question to Exploration: Test-Time Adaptation in Semantic Segmentation?","date":"2023-10-09","arxiv_id":"2310.05341","repositories_listed":1,"syntology":null},{"url":"/paper/online-class-incremental-learning-on","title":"Online Class Incremental Learning on Stochastic Blurry Task Boundary via Mask and Visual Prompt Tuning","date":"2023-08-18","arxiv_id":"2308.09303","repositories_listed":1,"syntology":null},{"url":"/paper/e-2vpt-an-effective-and-efficient-approach","title":"E^2VPT: An Effective and Efficient Approach for Visual Prompt Tuning","date":"2023-07-25","arxiv_id":"2307.13770","repositories_listed":1,"syntology":{"n":5,"n_ran":4,"n_unverified":1,"n_pointer_only":5}},{"url":"/paper/dvpt-dynamic-visual-prompt-tuning-of-large","title":"DVPT: Dynamic Visual Prompt Tuning of Large Pre-trained Models for Medical Image Analysis","date":"2023-07-19","arxiv_id":"2307.09787","repositories_listed":1,"syntology":null},{"url":"/paper/uncertainty-aware-state-space-transformer-for","title":"Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory Forecasting","date":"2023-07-17","arxiv_id":"2307.08243","repositories_listed":1,"syntology":{"n":13,"n_ran":9,"n_unverified":4,"n_pointer_only":0}}],"syntology_records":17,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}