{"url":"/method/adamax","slug":"adamax","name":"AdaMax","full_name":"AdaMax","full_name_withheld":false,"description_markdown":"**AdaMax** is a generalisation of [Adam](https://paperswithcode.com/method/adam) from the $l\\_{2}$ norm to the $l\\_{\\infty}$ norm. Define:\r\n\r\n$$ u\\_{t} = \\beta^{\\infty}\\_{2}v\\_{t-1} + \\left(1-\\beta^{\\infty}\\_{2}\\right)|g\\_{t}|^{\\infty}$$\r\n\r\n$$ = \\max\\left(\\beta\\_{2}\\cdot{v}\\_{t-1}, |g\\_{t}|\\right)$$\r\n\r\nWe can plug into the Adam update equation by replacing $\\sqrt{\\hat{v}_{t} + \\epsilon}$ with $u\\_{t}$ to obtain the AdaMax update rule:\r\n\r\n$$ \\theta\\_{t+1} = \\theta\\_{t} - \\frac{\\eta}{u\\_{t}}\\hat{m}\\_{t} $$\r\n\r\nCommon default values are $\\eta = 0.002$ and $\\beta\\_{1}=0.9$ and $\\beta\\_{2}=0.999$.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"http://arxiv.org/abs/1412.6980v9","title":"Adam: A Method for Stochastic Optimization","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/pytorch/pytorch/blob/b7bda236d18815052378c88081f64935427d7716/torch/optim/adamax.py#L5","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":9,"archive_num_papers":null,"papers_newest_first":[{"paper":null,"title":"New Insight in Cervical Cancer Diagnosis Using Convolution Neural Network Architecture","date":"2024-10-23","arxiv_id":"2410.17735","n_code_links":0,"syntology":null},{"paper":null,"title":"Should I try multiple optimizers when fine-tuning pre-trained Transformers for NLP tasks? Should I tune their hyperparameters?","date":"2024-02-10","arxiv_id":"2402.06948","n_code_links":0,"syntology":null},{"paper":null,"title":"A model for multi-attack classification to improve intrusion detection performance using deep learning approaches","date":"2023-10-25","arxiv_id":"2310.16380","n_code_links":0,"syntology":null},{"paper":null,"title":"ELRA: Exponential learning rate adaption gradient descent optimization method","date":"2023-09-12","arxiv_id":"2309.06274","n_code_links":0,"syntology":null},{"paper":null,"title":"Optimization Methods in Deep Learning: A Comprehensive Overview","date":"2023-02-19","arxiv_id":"2302.09566","n_code_links":0,"syntology":null},{"paper":null,"title":"Deep Transformer Model with Pre-Layer Normalization for COVID-19 Growth Prediction","date":"2022-07-10","arxiv_id":"2207.06356","n_code_links":0,"syntology":null},{"paper":"/paper/efficient-vdvae-less-is-more","title":"Efficient-VDVAE: Less is more","date":"2022-03-25","arxiv_id":"2203.13751","n_code_links":1,"syntology":null},{"paper":"/paper/nvae-a-deep-hierarchical-variational","title":"NVAE: A Deep Hierarchical Variational Autoencoder","date":"2020-07-08","arxiv_id":"2007.03898","n_code_links":10,"syntology":{"ran":23,"of":41,"unverified":18,"pointer_only":23}},{"paper":"/paper/adam-a-method-for-stochastic-optimization","title":"Adam: A Method for Stochastic Optimization","date":"2014-12-22","arxiv_id":"1412.6980","n_code_links":87,"syntology":{"ran":18,"of":37,"unverified":19,"pointer_only":8}}],"papers_shown":9,"tasks":[{"task":"/task/deep-learning","name":"Deep Learning","papers":2},{"task":"/task/image-generation","name":"Image Generation","papers":2},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":2},{"task":"/task/cancer-classification","name":"Cancer Classification","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/intrusion-detection","name":"Intrusion Detection","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":1},{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":1},{"task":"/task/time-series-1","name":"Time Series","papers":1},{"task":"/task/time-series","name":"Time Series Analysis","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1},{"task":"/task/speech-recognition-1","name":"speech-recognition","papers":1}],"tasks_shown":13,"n_tasks":13,"usage_by_year":[{"year":"2014","papers":1},{"year":"2020","papers":1},{"year":"2022","papers":2},{"year":"2023","papers":3},{"year":"2024","papers":2}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adamax"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}