{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/trainable-activations-for-image","title":"Trainable Activations for Image Classification","arxiv_id":null,"date":"2023-01-26","proceeding":"Preprints 2023 1","authors":["Evgenii Pishchik"],"abstract":"Non-linear activation functions are one of the main parts of deep neural network architectures. The choice of the activation function can affect model speed, performance and convergence. Most popular activation functions don't have any trainable parameters and don't alter during the training. We propose different activation functions with and without trainable parameters. Said activation functions have a number of advantages and disadvantages. We'll be testing the performance of said activation functions and comparing the results with widely known activation function ReLU. We assume that the activation functions with trainable parameters can outperform functions without ones, because the trainable parameters allow the model to \"select'' the type of each of the activation functions itself, however, this strongly depends on the architecture of the deep neural network and the activation function itself.","url_abs":"https://doi.org/10.20944/preprints202301.0463.v1","url_pdf":"https://www.preprints.org/manuscript/202301.0463/v1/download","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"trainable-activations-for-image","repo_url":"https://github.com/Pe4enIks/TrainableActivation","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"image-classification","task_name":"image-classification"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"coslu","method_name":"CosLU"},{"method_slug":"delu","method_name":"DELU"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"lincomb","method_name":"LinComb"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"normlincomb","method_name":"NormLinComb"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"relu6","method_name":"ReLU6"},{"method_slug":"relun","method_name":"ReLUN"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sgd","method_name":"SGD"},{"method_slug":"scaledsoftsign","method_name":"ScaledSoftSign"},{"method_slug":"shilu","method_name":"ShiLU"},{"method_slug":"silu","method_name":"SiLU"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"softsign-activation","method_name":"Softsign Activation"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"}],"datasets_introduced":[],"methods_introduced":[{"slug":"coslu","name":"CosLU","full_name":"Cosine Linear Unit"},{"slug":"delu","name":"DELU","full_name":"DELU"},{"slug":"lincomb","name":"LinComb","full_name":"Linear Combination of Activations"},{"slug":"normlincomb","name":"NormLinComb","full_name":"Normalized Linear Combination of Activations"},{"slug":"relun","name":"ReLUN","full_name":"Rectified Linear Unit N"},{"slug":"scaledsoftsign","name":"ScaledSoftSign","full_name":"ScaledSoftSign"},{"slug":"shilu","name":"ShiLU","full_name":"Shifted Rectified Linear Unit"}],"results":[{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-26 (Trainable Activations)","rank_in_archive_order":196,"of":265,"metrics":{"Percentage correct":"91.1"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-32 (Trainable Activations)","rank_in_archive_order":197,"of":265,"metrics":{"Percentage correct":"90.9"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-44 (Trainable Activations)","rank_in_archive_order":204,"of":265,"metrics":{"Percentage correct":"90.5"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-20 (Trainable Activations)","rank_in_archive_order":205,"of":265,"metrics":{"Percentage correct":"90.4"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-14 (Trainable Activations)","rank_in_archive_order":212,"of":265,"metrics":{"Percentage correct":"89.0"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-56 (Trainable Activations)","rank_in_archive_order":215,"of":265,"metrics":{"Percentage correct":"88.8"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-cifar-10","task":"Image Classification","dataset":"CIFAR-10","model":"ResNet-8 (Trainable Activations)","rank_in_archive_order":228,"of":265,"metrics":{"Percentage correct":"86.5"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-mnist","task":"Image Classification","dataset":"MNIST","model":"DNN-5 (Trainable Activations)","rank_in_archive_order":59,"of":81,"metrics":{"Accuracy":"97.2","Percentage error":"2.8","Trainable Parameters":"575051"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-mnist","task":"Image Classification","dataset":"MNIST","model":"DNN-3 (Trainable Activations)","rank_in_archive_order":60,"of":81,"metrics":{"Accuracy":"97.0","Percentage error":"3.0","Trainable Parameters":"386719"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-mnist","task":"Image Classification","dataset":"MNIST","model":"DNN-2 (Trainable Activations)","rank_in_archive_order":61,"of":81,"metrics":{"Accuracy":"96.4","Percentage error":"3.6","Trainable Parameters":"311651"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}