{"url":"/method/adabelief","slug":"adabelief","name":"Adabelief","full_name":"Adabelief","full_name_withheld":false,"description_markdown":null,"description_state":"absent","introduced_year":null,"introduced_by":{"title":"AdaBelief Optimizer: Adapting Stepsizes by the Belief in Observed Gradients","paper":"/paper/adabelief-optimizer-adapting-stepsizes-by-the","first_author":"Juntang Zhuang","n_authors":7,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/adabelief-optimizer-adapting-stepsizes-by-the"},"source":{"url":"https://arxiv.org/abs/2010.07468v5","title":"AdaBelief Optimizer: Adapting Stepsizes by the Belief in Observed Gradients","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":19,"archive_num_papers":19,"papers_newest_first":[{"paper":null,"title":"Covariant Gradient Descent","date":"2025-04-07","arxiv_id":"2504.05279","n_code_links":0,"syntology":null},{"paper":null,"title":"AdamL: A fast adaptive gradient method incorporating loss function","date":"2023-12-23","arxiv_id":"2312.15295","n_code_links":0,"syntology":null},{"paper":"/paper/adaplus-integrating-nesterov-momentum-and","title":"AdaPlus: Integrating Nesterov Momentum and Precise Stepsize Adjustment on AdamW Basis","date":"2023-09-05","arxiv_id":"2309.01966","n_code_links":1,"syntology":null},{"paper":null,"title":"On Suppressing Range of Adaptive Stepsizes of Adam to Improve Generalisation Performance","date":"2023-02-02","arxiv_id":"2302.01029","n_code_links":0,"syntology":null},{"paper":"/paper/optimization-without-backpropagation","title":"Optimization without Backpropagation","date":"2022-09-13","arxiv_id":"2209.06302","n_code_links":1,"syntology":{"ran":0,"of":8,"unverified":8,"pointer_only":0}},{"paper":"/paper/moment-centralization-based-gradient-descent","title":"Moment Centralization based Gradient Descent Optimizers for Convolutional Neural Networks","date":"2022-07-19","arxiv_id":"2207.09066","n_code_links":1,"syntology":null},{"paper":"/paper/efficient-adaptive-ensembling-for-image","title":"Efficient Adaptive Ensembling for Image Classification","date":"2022-06-15","arxiv_id":"2206.07394","n_code_links":0,"syntology":null},{"paper":null,"title":"A Control Theoretic Framework for Adaptive Gradient Optimizers in Machine Learning","date":"2022-06-04","arxiv_id":"2206.02034","n_code_links":0,"syntology":null},{"paper":"/paper/on-exploiting-layerwise-gradient-statistics","title":"A DNN Optimizer that Improves over AdaBelief by Suppression of the Adaptive Stepsize Range","date":"2022-03-24","arxiv_id":"2203.13273","n_code_links":1,"syntology":null},{"paper":null,"title":"AdaFamily: A family of Adam-like adaptive gradient methods","date":"2022-03-03","arxiv_id":"2203.01603","n_code_links":0,"syntology":null},{"paper":"/paper/improvements-to-short-term-weather-prediction","title":"Improvements to short-term weather prediction with recurrent-convolutional networks","date":"2021-11-11","arxiv_id":"2111.06240","n_code_links":1,"syntology":null},{"paper":"/paper/effectiveness-of-optimization-algorithms-in","title":"Effectiveness of Optimization Algorithms in Deep Image Classification","date":"2021-10-04","arxiv_id":"2110.01598","n_code_links":1,"syntology":null},{"paper":"/paper/using-self-supervised-co-training-to-improve","title":"Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation","date":"2021-05-13","arxiv_id":"2105.06421","n_code_links":0,"syntology":null},{"paper":null,"title":"FastAdaBelief: Improving Convergence Rate for Belief-based Adaptive Optimizers by Exploiting Strong Convexity","date":"2021-04-28","arxiv_id":"2104.13790","n_code_links":0,"syntology":null},{"paper":null,"title":"Adversarial example generation with AdaBelief Optimizer and Crop Invariance","date":"2021-02-07","arxiv_id":"2102.03726","n_code_links":0,"syntology":null},{"paper":null,"title":"Generalizing Adversarial Examples by AdaBelief Optimizer","date":"2021-01-25","arxiv_id":"2101.09930","n_code_links":0,"syntology":null},{"paper":"/paper/fcm-rdpa-tsk-fuzzy-regression-model","title":"FCM-RDpA: TSK Fuzzy Regression Model Construction Using Fuzzy C-Means Clustering, Regularization, DropRule, and Powerball AdaBelief","date":"2020-11-30","arxiv_id":"2012.00060","n_code_links":2,"syntology":null},{"paper":"/paper/eadam-optimizer-how-e-impact-adam","title":"EAdam Optimizer: How $ε$ Impact Adam","date":"2020-11-04","arxiv_id":"2011.02150","n_code_links":2,"syntology":null},{"paper":"/paper/adabelief-optimizer-adapting-stepsizes-by-the","title":"AdaBelief Optimizer: Adapting Stepsizes by the Belief in Observed Gradients","date":"2020-10-15","arxiv_id":"2010.07468","n_code_links":8,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}}],"papers_shown":19,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":10},{"task":"/task/image-classification","name":"image-classification","papers":9},{"task":"/task/language-modelling","name":"Language Modelling","papers":4},{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/classification-1","name":"Classification","papers":2},{"task":"/task/image-generation","name":"Image Generation","papers":2},{"task":"/task/machine-learning","name":"BIG-bench Machine Learning","papers":1},{"task":"/task/clustering","name":"Clustering","papers":1},{"task":"/task/emotion-recognition","name":"Emotion Recognition","papers":1},{"task":"/task/facial-emotion-recognition","name":"Facial Emotion Recognition","papers":1},{"task":"/task/facial-expression-recognition","name":"Facial Expression Recognition (FER)","papers":1},{"task":"/task/head-pose-estimation","name":"Head Pose Estimation","papers":1},{"task":"/task/multi-task-learning","name":"Multi-Task Learning","papers":1},{"task":"/task/pose-estimation","name":"Pose Estimation","papers":1},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":1},{"task":"/task/regression-1","name":"regression","papers":1}],"tasks_shown":16,"n_tasks":16,"usage_by_year":[{"year":"2020","papers":3},{"year":"2021","papers":6},{"year":"2022","papers":6},{"year":"2023","papers":3},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adabelief"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}