{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/improving-image-clustering-with-artifacts","title":"Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering","arxiv_id":"2410.04801","date":"2024-10-07","proceeding":null,"authors":["Kazumoto Nakamura","Yuji Nozawa","Yu-Chieh Lin","Kengo Nakata","Youyang Ng"],"abstract":"The goal of this paper is to improve the performance of pretrained Vision Transformer (ViT) models, particularly DINOv2, in image clustering task without requiring re-training or fine-tuning. As model size increases, high-norm artifacts anomaly appears in the patches of multi-head attention. We observe that this anomaly leads to reduced accuracy in zero-shot image clustering. These artifacts are characterized by disproportionately large values in the attention map compared to other patch tokens. To address these artifacts, we propose an approach called Inference-Time Attention Engineering (ITAE), which manipulates attention function during inference. Specifically, we identify the artifacts by investigating one of the Query-Key-Value (QKV) patches in the multi-head attention and attenuate their corresponding attention values inside the pretrained models. ITAE shows improved clustering accuracy on multiple datasets by exhibiting more expressive features in latent space. Our findings highlight the potential of ITAE as a practical solution for reducing artifacts in pretrained ViT models and improving model performance in clustering tasks without the need for re-training or fine-tuning.","url_abs":"https://arxiv.org/abs/2410.04801v1","url_pdf":"https://arxiv.org/pdf/2410.04801v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"clustering","task_name":"Clustering"},{"task_slug":"image-clustering","task_name":"Image Clustering"}],"methods":[{"method_slug":"absolute-position-encodings","method_name":"Absolute Position Encodings"},{"method_slug":"adam","method_name":"Adam"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"label-smoothing","method_name":"Label Smoothing"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"position-wise-feed-forward-layer","method_name":"Position-Wise Feed-Forward Layer"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"transformer","method_name":"Transformer"},{"method_slug":"vision-transformer","method_name":"Vision Transformer"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-clustering-on-cifar-10","task":"Image Clustering","dataset":"CIFAR-10","model":"ITAE","rank_in_archive_order":23,"of":40,"metrics":{"ARI":"0.7946","Accuracy":"0.8449","Backbone":"ViT-B/14","NMI":"0.8682","Train set":"Test"},"uses_additional_data":true},{"leaderboard":"/sota/image-clustering-on-cifar-100","task":"Image Clustering","dataset":"CIFAR-100","model":"ITAE","rank_in_archive_order":6,"of":30,"metrics":{"ARI":"0.5053","Accuracy":"0.6502","Backbone":"ViT-B/14","NMI":"0.771","Train Set":"Test"},"uses_additional_data":true},{"leaderboard":"/sota/image-clustering-on-stl-10","task":"Image Clustering","dataset":"STL-10","model":"ITAE","rank_in_archive_order":14,"of":29,"metrics":{"ARI":"0.7594","Accuracy":"0.8276","Backbone":"ViT-B/14","NMI":"0.8818","Train Split":"Test"},"uses_additional_data":true},{"leaderboard":"/sota/image-clustering-on-tiny-imagenet","task":"Image Clustering","dataset":"Tiny-ImageNet","model":"ITAE","rank_in_archive_order":2,"of":14,"metrics":{"ARI":"0.5227","Accuracy":"0.6823","NMI":"0.8178"},"uses_additional_data":true}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2410.04801","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}