{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/wavemix-lite-a-resource-efficient-neural","title":"WaveMix: A Resource-efficient Neural Network for Image Analysis","arxiv_id":"2205.14375","date":"2022-05-28","proceeding":null,"authors":["Pranav Jeevan","Kavitha Viswanathan","Anandu A S","Amit Sethi"],"abstract":"We propose a novel neural architecture for computer vision -- WaveMix -- that is resource-efficient and yet generalizable and scalable. While using fewer trainable parameters, GPU RAM, and computations, WaveMix networks achieve comparable or better accuracy than the state-of-the-art convolutional neural networks, vision transformers, and token mixers for several tasks. This efficiency can translate to savings in time, cost, and energy. To achieve these gains we used multi-level two-dimensional discrete wavelet transform (2D-DWT) in WaveMix blocks, which has the following advantages: (1) It reorganizes spatial information based on three strong image priors -- scale-invariance, shift-invariance, and sparseness of edges -- (2) in a lossless manner without adding parameters, (3) while also reducing the spatial sizes of feature maps, which reduces the memory and time required for forward and backward passes, and (4) expanding the receptive field faster than convolutions do. The whole architecture is a stack of self-similar and resolution-preserving WaveMix blocks, which allows architectural flexibility for various tasks and levels of resource availability. WaveMix establishes new benchmarks for segmentation on Cityscapes; and for classification on Galaxy 10 DECals, Places-365, five EMNIST datasets, and iNAT-mini and performs competitively on other benchmarks. Our code and trained models are publicly available.","url_abs":"https://arxiv.org/abs/2205.14375v5","url_pdf":"https://arxiv.org/pdf/2205.14375v5.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"wavemix-lite-a-resource-efficient-neural","repo_url":"https://github.com/pranavphoenix/WaveMix","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"efficient-neural-network","task_name":"Efficient Neural Network"},{"task_slug":null,"task_name":"GPU"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"scene-classification","task_name":"Scene Classification"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"spatial-token-mixer","task_name":"Spatial Token Mixer"}],"methods":[{"method_slug":"2d-dwt","method_name":"2D DWT"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"mlp-mixer","method_name":"MLP-Mixer"},{"method_slug":"poolformer","method_name":"PoolFormer"},{"method_slug":"residual-connection","method_name":"Residual Connection"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"WaveMixLite-144/7","rank_in_archive_order":89,"of":265,"metrics":{"Percentage correct":"97.29"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"WaveMixLite-256/7","rank_in_archive_order":68,"of":211,"metrics":{"Percentage correct":"85.09"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-cifar-100","task":"Image Classification","dataset":"CIFAR-100","model":"WaveMix-Lite-256/7","rank_in_archive_order":175,"of":211,"metrics":{"Percentage correct":"70.20"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-caltech-256","task":"Image Classification","dataset":"Caltech-256","model":"WaveMixLite-256/7","rank_in_archive_order":5,"of":5,"metrics":{"Accuracy":"54.62"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-emnist-balanced","task":"Image Classification","dataset":"EMNIST-Balanced","model":"WaveMixLite-128/7","rank_in_archive_order":3,"of":20,"metrics":{"Accuracy":"91.06"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-emnist-byclass","task":"Image Classification","dataset":"EMNIST-Byclass","model":"WaveMixLite-128/7","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"88.43"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-emnist-bymerge","task":"Image Classification","dataset":"EMNIST-Bymerge","model":"WaveMixLite-128/16","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy":"91.80"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-emnist-digits","task":"Image Classification","dataset":"EMNIST-Digits","model":"WaveMixLite-112/16","rank_in_archive_order":1,"of":7,"metrics":{"Accuracy (%)":"99.82"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-emnist-letters","task":"Image Classification","dataset":"EMNIST-Letters","model":"WaveMixLite-112/16","rank_in_archive_order":1,"of":11,"metrics":{"Accuracy":"95.96"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-fashion-mnist","task":"Image Classification","dataset":"Fashion-MNIST","model":"WaveMixLite","rank_in_archive_order":6,"of":34,"metrics":{"Percentage error":"5.68"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-galaxy10-decals","task":"Image Classification","dataset":"Galaxy10 DECals","model":"WaveMix","rank_in_archive_order":1,"of":2,"metrics":{"PARAMS (M)":"28","Top-1 Accuracy (%)":"95.42"},"uses_additional_data":true},{"leaderboard":"/sota/image-classification-on-imagenet","task":"Image Classification","dataset":"ImageNet","model":"WaveMix-192/16 (level 3)","rank_in_archive_order":964,"of":1060,"metrics":{"Top 1 Accuracy":"74.93%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-places365-standard","task":"Image Classification","dataset":"Places365-Standard","model":"WaveMix-240/12 (level 4)","rank_in_archive_order":4,"of":4,"metrics":{"Top 1 Accuracy":"56.45"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-stl-10","task":"Image Classification","dataset":"STL-10","model":"WaveMixLite-256/7","rank_in_archive_order":89,"of":117,"metrics":{"Percentage correct":"70.88"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-svhn","task":"Image Classification","dataset":"SVHN","model":"WaveMixLite-144/15","rank_in_archive_order":5,"of":62,"metrics":{"Percentage error":"1.27"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-tiny-imagenet-1","task":"Image Classification","dataset":"Tiny ImageNet Classification","model":"WaveMixLite-144/7","rank_in_archive_order":10,"of":23,"metrics":{"Validation Acc":"77.47%"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-inat2021-mini","task":"Image Classification","dataset":"iNat2021-mini","model":"WaveMix-256/16 (level 2)","rank_in_archive_order":1,"of":1,"metrics":{"Top 1 Accuracy":"61.75"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-mnist-1","task":"Image Classification","dataset":"mnist","model":"WaveMixLite","rank_in_archive_order":1,"of":1,"metrics":{"Percentage error":"0.25"},"uses_additional_data":false},{"leaderboard":"/sota/scene-classification-on-places365-standard","task":"Scene Classification","dataset":"Places365-Standard","model":"WaveMix","rank_in_archive_order":1,"of":2,"metrics":{"Top 1 Error":"43.55"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-cityscapes-val","task":"Semantic Segmentation","dataset":"Cityscapes val","model":"WaveMix","rank_in_archive_order":33,"of":99,"metrics":{"mIoU":"82.7"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-cityscapes-val","task":"Semantic Segmentation","dataset":"Cityscapes val","model":"WaveMix-256/16 (Level-4)","rank_in_archive_order":35,"of":99,"metrics":{"mIoU":"82.60"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}