{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/deep-clustering-via-joint-convolutional","title":"Deep Clustering via Joint Convolutional Autoencoder Embedding and Relative Entropy Minimization","arxiv_id":"1704.06327","date":"2017-04-20","proceeding":"ICCV 2017 10","authors":["Kamran Ghasedi Dizaji","Amirhossein Herandi","Cheng Deng","Weidong Cai","Heng Huang"],"abstract":"Image clustering is one of the most important computer vision applications,\nwhich has been extensively studied in literature. However, current clustering\nmethods mostly suffer from lack of efficiency and scalability when dealing with\nlarge-scale and high-dimensional data. In this paper, we propose a new\nclustering model, called DEeP Embedded RegularIzed ClusTering (DEPICT), which\nefficiently maps data into a discriminative embedding subspace and precisely\npredicts cluster assignments. DEPICT generally consists of a multinomial\nlogistic regression function stacked on top of a multi-layer convolutional\nautoencoder. We define a clustering objective function using relative entropy\n(KL divergence) minimization, regularized by a prior for the frequency of\ncluster assignments. An alternating strategy is then derived to optimize the\nobjective by updating parameters and estimating cluster assignments.\nFurthermore, we employ the reconstruction loss functions in our autoencoder, as\na data-dependent regularization term, to prevent the deep embedding function\nfrom overfitting. In order to benefit from end-to-end optimization and\neliminate the necessity for layer-wise pretraining, we introduce a joint\nlearning framework to minimize the unified clustering and reconstruction loss\nfunctions together and train all network layers simultaneously. Experimental\nresults indicate the superiority and faster running time of DEPICT in\nreal-world clustering tasks, where no labeled data is available for\nhyper-parameter tuning.","url_abs":"http://arxiv.org/abs/1704.06327v3","url_pdf":"http://arxiv.org/pdf/1704.06327v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"deep-clustering-via-joint-convolutional","repo_url":"https://github.com/herandy/DEPICT","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"clustering","task_name":"Clustering"},{"task_slug":"deep-clustering","task_name":"Deep Clustering"},{"task_slug":"image-clustering","task_name":"Image Clustering"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-clustering-on-cmu-pie","task":"Image Clustering","dataset":"CMU-PIE","model":"DEPICT","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"0.850","NMI":"0.964"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-cub-birds","task":"Image Clustering","dataset":"CUB Birds","model":"DEPICT-Large","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"0.061","NMI":"0.297"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-cub-birds","task":"Image Clustering","dataset":"CUB Birds","model":"DEPICT","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"0.061","NMI":"0.290"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-frgc","task":"Image Clustering","dataset":"FRGC","model":"DEPICT","rank_in_archive_order":1,"of":3,"metrics":{"Accuracy":"0.432","NMI":"0.583"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-stanford-cars","task":"Image Clustering","dataset":"Stanford Cars","model":"DEPICT","rank_in_archive_order":3,"of":5,"metrics":{"Accuracy":"0.063","NMI":"0.329"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-stanford-cars","task":"Image Clustering","dataset":"Stanford Cars","model":"DEPICT-Large","rank_in_archive_order":4,"of":5,"metrics":{"Accuracy":"0.062","NMI":"0.330"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-stanford-dogs","task":"Image Clustering","dataset":"Stanford Dogs","model":"DEPICT-Large","rank_in_archive_order":2,"of":4,"metrics":{"Accuracy":"0.054","NMI":"0.183"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-stanford-dogs","task":"Image Clustering","dataset":"Stanford Dogs","model":"DEPICT","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"0.052","NMI":"0.182"},"uses_additional_data":false},{"leaderboard":"/sota/image-clustering-on-youtube-faces-db","task":"Image Clustering","dataset":"YouTube Faces DB","model":"DEPICT","rank_in_archive_order":3,"of":4,"metrics":{"Accuracy":"0.611","NMI":"0.802"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1704.06327","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}