{"url":"/method/adadelta","slug":"adadelta","name":"AdaDelta","full_name":"AdaDelta","full_name_withheld":false,"description_markdown":"**AdaDelta** is a stochastic optimization technique that allows for per-dimension learning rate method for [SGD](https://paperswithcode.com/method/sgd). It is an extension of [Adagrad](https://paperswithcode.com/method/adagrad) that seeks to reduce its aggressive, monotonically decreasing learning rate. Instead of accumulating all past squared gradients, Adadelta restricts the window of accumulated past gradients to a fixed size $w$.\r\n\r\nInstead of inefficiently storing $w$ previous squared gradients, the sum of gradients is recursively defined as a decaying average of all past squared gradients. The running average $E\\left[g^{2}\\right]\\_{t}$ at time step $t$ then depends only on the previous average and current gradient:\r\n\r\n$$E\\left[g^{2}\\right]\\_{t} = \\gamma{E}\\left[g^{2}\\right]\\_{t-1} + \\left(1-\\gamma\\right)g^{2}\\_{t}$$\r\n\r\nUsually $\\gamma$ is set to around $0.9$. Rewriting SGD updates in terms of the parameter update vector:\r\n\r\n$$ \\Delta\\theta_{t} = -\\eta\\cdot{g\\_{t, i}}$$\r\n$$\\theta\\_{t+1}  = \\theta\\_{t} + \\Delta\\theta_{t}$$\r\n\r\nAdaDelta takes the form:\r\n\r\n$$ \\Delta\\theta_{t} = -\\frac{\\eta}{\\sqrt{E\\left[g^{2}\\right]\\_{t} + \\epsilon}}g_{t} $$\r\n\r\nThe main advantage of AdaDelta is that we do not need to set a default learning rate.","description_state":"present","introduced_year":null,"introduced_by":{"title":"ADADELTA: An Adaptive Learning Rate Method","paper":"/paper/adadelta-an-adaptive-learning-rate-method","first_author":"Matthew D. Zeiler","n_authors":1,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adadelta-an-adaptive-learning-rate-method"},"source":{"url":"http://arxiv.org/abs/1212.5701v1","title":"ADADELTA: An Adaptive Learning Rate Method","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/pytorch/pytorch/blob/b7bda236d18815052378c88081f64935427d7716/torch/optim/adadelta.py#L6","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":17,"archive_num_papers":17,"papers_newest_first":[{"paper":null,"title":"Accelerating Energy-Efficient Federated Learning in Cell-Free Networks with Adaptive Quantization","date":"2024-12-30","arxiv_id":"2412.20785","n_code_links":0,"syntology":null},{"paper":null,"title":"New Insight in Cervical Cancer Diagnosis Using Convolution Neural Network Architecture","date":"2024-10-23","arxiv_id":"2410.17735","n_code_links":0,"syntology":null},{"paper":"/paper/a-parallelized-adam-based-solver-for-reserve","title":"A Parallelized, Adam-Based Solver for Reserve and Security Constrained AC Unit Commitment","date":"2023-10-10","arxiv_id":"2310.06650","n_code_links":1,"syntology":null},{"paper":null,"title":"ELRA: Exponential learning rate adaption gradient descent optimization method","date":"2023-09-12","arxiv_id":"2309.06274","n_code_links":0,"syntology":null},{"paper":null,"title":"Occupant's Behavior and Emotion Based Indoor Environment's Illumination Regulation","date":"2023-02-19","arxiv_id":"2302.09586","n_code_links":0,"syntology":null},{"paper":null,"title":"BFE and AdaBFE: A New Approach in Learning Rate Automation for Stochastic Optimization","date":"2022-07-06","arxiv_id":"2207.02763","n_code_links":0,"syntology":null},{"paper":null,"title":"Gradient Descent, Stochastic Optimization, and Other Tales","date":"2022-05-02","arxiv_id":"2205.00832","n_code_links":0,"syntology":null},{"paper":"/paper/adasmooth-an-adaptive-learning-rate-method","title":"AdaSmooth: An Adaptive Learning Rate Method based on Effective Ratio","date":"2022-04-02","arxiv_id":"2204.00825","n_code_links":0,"syntology":null},{"paper":"/paper/adaptively-customizing-activation-functions","title":"Adaptively Customizing Activation Functions for Various Layers","date":"2021-12-17","arxiv_id":"2112.09442","n_code_links":1,"syntology":null},{"paper":"/paper/tom-leveraging-trend-of-the-observed","title":"Tom: Leveraging trend of the observed gradients for faster convergence","date":"2021-09-07","arxiv_id":"2109.03820","n_code_links":2,"syntology":null},{"paper":null,"title":"Exploiting Adam-like Optimization Algorithms to Improve the Performance of Convolutional Neural Networks","date":"2021-03-26","arxiv_id":"2103.14689","n_code_links":0,"syntology":null},{"paper":"/paper/an-adaptive-and-momental-bound-method-for","title":"An Adaptive and Momental Bound Method for Stochastic Learning","date":"2019-10-27","arxiv_id":"1910.12249","n_code_links":2,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":"/paper/diffgrad-an-optimization-method-for","title":"diffGrad: An Optimization Method for Convolutional Neural Networks","date":"2019-09-12","arxiv_id":"1909.11015","n_code_links":1,"syntology":null},{"paper":"/paper/on-the-convergence-of-adam-and-beyond-1","title":"On the Convergence of Adam and Beyond","date":"2019-04-19","arxiv_id":"1904.09237","n_code_links":3,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":"/paper/adaptive-methods-for-nonconvex-optimization","title":"Adaptive Methods for Nonconvex Optimization","date":"2018-12-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/online-batch-selection-for-faster-training-of","title":"Online Batch Selection for Faster Training of Neural Networks","date":"2015-11-19","arxiv_id":"1511.06343","n_code_links":1,"syntology":null},{"paper":"/paper/adadelta-an-adaptive-learning-rate-method","title":"ADADELTA: An Adaptive Learning Rate Method","date":"2012-12-22","arxiv_id":"1212.5701","n_code_links":12,"syntology":{"ran":0,"of":6,"unverified":6,"pointer_only":0}}],"papers_shown":17,"tasks":[{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":6},{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/benchmarking","name":"Benchmarking","papers":1},{"task":"/task/cancer-classification","name":"Cancer Classification","papers":1},{"task":"/task/federated-learning","name":"Federated Learning","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/image-categorization","name":"Image Categorization","papers":1},{"task":"/task/multi-class-classification","name":"Multi-class Classification","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1}],"tasks_shown":11,"n_tasks":11,"usage_by_year":[{"year":"2012","papers":1},{"year":"2015","papers":1},{"year":"2018","papers":1},{"year":"2019","papers":3},{"year":"2021","papers":3},{"year":"2022","papers":3},{"year":"2023","papers":3},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adadelta"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}