{"url":"/method/adahessian","slug":"adahessian","name":"AdaHessian","full_name":"ADAHESSIAN","full_name_withheld":false,"description_markdown":"ADAHESSIAN is a new stochastic optimization algorithm that directly incorporates approximate curvature information from the loss function, and it includes several novel performance-improving features, including a fast Hutchinson based method to approximate the curvature matrix with low computational overhead.","description_state":"present","introduced_year":null,"introduced_by":{"title":"ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning","paper":"/paper/adahessian-an-adaptive-second-order-optimizer","first_author":"Zhewei Yao","n_authors":6,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adahessian-an-adaptive-second-order-optimizer"},"source":{"url":"https://arxiv.org/abs/2006.00719v3","title":"ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]},{"area":"General","area_id":"general","collection":"Optimization","url":"/methods/category/optimization","pwc_aliases":[]}],"n_papers_tagged":6,"archive_num_papers":6,"papers_newest_first":[{"paper":null,"title":"A Dynamic Weighting Strategy to Mitigate Worker Node Failure in Distributed Deep Learning","date":"2024-09-14","arxiv_id":"2409.09242","n_code_links":0,"syntology":null},{"paper":null,"title":"SOFIM: Stochastic Optimization Using Regularized Fisher Information Matrix","date":"2024-03-05","arxiv_id":"2403.02833","n_code_links":0,"syntology":null},{"paper":"/paper/sania-polyak-type-optimization-framework","title":"SANIA: Polyak-type Optimization Framework Leads to Scale Invariant Stochastic Algorithms","date":"2023-12-28","arxiv_id":"2312.17369","n_code_links":1,"syntology":{"ran":10,"of":10,"unverified":0,"pointer_only":10}},{"paper":null,"title":"On Scaled Methods for Saddle Point Problems","date":"2022-06-16","arxiv_id":"2206.08303","n_code_links":0,"syntology":null},{"paper":"/paper/adaptive-optimizers-with-sparse-group-lasso-1","title":"Adaptive Optimizers with Sparse Group Lasso for Neural Networks in CTR Prediction","date":"2021-07-30","arxiv_id":"2107.14432","n_code_links":2,"syntology":null},{"paper":"/paper/adahessian-an-adaptive-second-order-optimizer","title":"ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning","date":"2020-06-01","arxiv_id":"2006.00719","n_code_links":4,"syntology":{"ran":1,"of":11,"unverified":10,"pointer_only":0}}],"papers_shown":6,"tasks":[{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":2},{"task":"/task/machine-learning","name":"BIG-bench Machine Learning","papers":1},{"task":"/task/click-through-rate-prediction","name":"Click-Through Rate Prediction","papers":1},{"task":"/task/deep-learning","name":"Deep Learning","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/second-order-methods","name":"Second-order methods","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1}],"tasks_shown":7,"n_tasks":7,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":1},{"year":"2022","papers":1},{"year":"2023","papers":1},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adahessian"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}