{"url":"/method/adan","slug":"adan","name":"Adan","full_name":"Adaptive Nesterov Momentum","full_name_withheld":false,"description_markdown":null,"description_state":"placeholder","introduced_year":null,"introduced_by":{"title":"Adan: Adaptive Nesterov Momentum Algorithm for Faster Optimizing Deep Models","paper":"/paper/adan-adaptive-nesterov-momentum-algorithm-for","first_author":"Xingyu Xie","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adan-adaptive-nesterov-momentum-algorithm-for"},"source":{"url":"https://arxiv.org/abs/2208.06677v5","title":"Adan: Adaptive Nesterov Momentum Algorithm for Faster Optimizing Deep Models","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Optimization","url":"/methods/category/optimization","pwc_aliases":[]}],"n_papers_tagged":4,"archive_num_papers":4,"papers_newest_first":[{"paper":null,"title":"Adaptive Gradient Regularization: A Faster and Generalizable Optimization Technique for Deep Neural Networks","date":"2024-07-24","arxiv_id":"2407.16944","n_code_links":0,"syntology":null},{"paper":"/paper/collie-collaborative-training-of-large","title":"CoLLiE: Collaborative Training of Large Language Models in an Efficient Way","date":"2023-12-01","arxiv_id":"2312.00407","n_code_links":1,"syntology":{"ran":4,"of":7,"unverified":3,"pointer_only":0}},{"paper":null,"title":"UAdam: Unified Adam-Type Algorithmic Framework for Non-Convex Stochastic Optimization","date":"2023-05-09","arxiv_id":"2305.05675","n_code_links":0,"syntology":null},{"paper":"/paper/adan-adaptive-nesterov-momentum-algorithm-for","title":"Adan: Adaptive Nesterov Momentum Algorithm for Faster Optimizing Deep Models","date":"2022-08-13","arxiv_id":"2208.06677","n_code_links":9,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}}],"papers_shown":4,"tasks":[{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":2},{"task":"/task/deep-learning","name":"Deep Learning","papers":1},{"task":null,"name":"GPU","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/image-generation","name":"Image Generation","papers":1},{"task":"/task/type","name":"Vocal Bursts Type Prediction","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1},{"task":"/task/parameter-efficient-fine-tuning","name":"parameter-efficient fine-tuning","papers":1}],"tasks_shown":8,"n_tasks":8,"usage_by_year":[{"year":"2022","papers":1},{"year":"2023","papers":2},{"year":"2024","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adan"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}