{"url":"/method/adam","slug":"adam","name":"Adam","full_name":"Adam","full_name_withheld":false,"description_markdown":"**Adam** is an adaptive learning rate optimization algorithm that utilises both momentum and scaling, combining the benefits of [RMSProp](https://paperswithcode.com/method/rmsprop) and [SGD w/th Momentum](https://paperswithcode.com/method/sgd-with-momentum). The optimizer is designed to be appropriate for non-stationary objectives and problems with very noisy and/or sparse gradients. \r\n\r\nThe weight updates are performed as:\r\n\r\n$$ w_{t} = w_{t-1} - \\eta\\frac{\\hat{m}\\_{t}}{\\sqrt{\\hat{v}\\_{t}} + \\epsilon}  $$\r\n\r\nwith\r\n\r\n$$ \\hat{m}\\_{t} = \\frac{m_{t}}{1-\\beta^{t}_{1}} $$\r\n\r\n$$ \\hat{v}\\_{t} = \\frac{v_{t}}{1-\\beta^{t}_{2}} $$\r\n\r\n$$ m_{t} = \\beta_{1}m_{t-1} + (1-\\beta_{1})g_{t} $$\r\n\r\n$$ v_{t} = \\beta_{2}v_{t-1} + (1-\\beta_{2})g_{t}^{2}  $$\r\n\r\n\r\n$ \\eta $ is the step size/learning rate, around 1e-3 in the original paper. $ \\epsilon $ is a small number, typically 1e-8 or 1e-10, to prevent dividing by zero. $ \\beta_{1} $ and $ \\beta_{2} $ are forgetting parameters, with typical values 0.9 and 0.999, respectively.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"http://arxiv.org/abs/1412.6980v9","title":"Adam: A Method for Stochastic Optimization","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/pytorch/pytorch/blob/b7bda236d18815052378c88081f64935427d7716/torch/optim/adam.py#L6","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Stochastic Optimization","url":"/methods/category/stochastic-optimization","pwc_aliases":[]}],"n_papers_tagged":24390,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/constructing-and-evaluating-declarative-rag","title":"Constructing and Evaluating Declarative RAG Pipelines in PyTerrier","date":"2025-06-12","arxiv_id":"2506.10802","n_code_links":1,"syntology":null},{"paper":"/paper/pylo-towards-accessible-learned-optimizers-in","title":"PyLO: Towards Accessible Learned Optimizers in PyTorch","date":"2025-06-12","arxiv_id":"2506.10315","n_code_links":1,"syntology":null},{"paper":"/paper/towards-robust-multimodal-emotion-recognition","title":"Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts","date":"2025-06-12","arxiv_id":"2506.10452","n_code_links":1,"syntology":null},{"paper":null,"title":"A Novel Lightweight Transformer with Edge-Aware Fusion for Remote Sensing Image Captioning","date":"2025-06-11","arxiv_id":"2506.09429","n_code_links":0,"syntology":null},{"paper":null,"title":"Auto-Compressing Networks","date":"2025-06-11","arxiv_id":"2506.09714","n_code_links":0,"syntology":null},{"paper":"/paper/learning-efficient-and-generalizable-graph","title":"Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering","date":"2025-06-11","arxiv_id":"2506.09645","n_code_links":1,"syntology":null},{"paper":null,"title":"SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot","date":"2025-06-11","arxiv_id":"2506.09613","n_code_links":0,"syntology":null},{"paper":null,"title":"Online Learning-guided Learning Rate Adaptation via Gradient Alignment","date":"2025-06-10","arxiv_id":"2506.08419","n_code_links":0,"syntology":null},{"paper":null,"title":"ADAM: Autonomous Discovery and Annotation Model using LLMs for Context-Aware Annotations","date":"2025-06-10","arxiv_id":"2506.08968","n_code_links":0,"syntology":null},{"paper":"/paper/an-adaptive-method-stabilizing-activations","title":"An Adaptive Method Stabilizing Activations for Enhanced Generalization","date":"2025-06-10","arxiv_id":"2506.08353","n_code_links":1,"syntology":null},{"paper":null,"title":"FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed","date":"2025-06-10","arxiv_id":"2506.09034","n_code_links":0,"syntology":null},{"paper":null,"title":"Hierarchical Neural Collapse Detection Transformer for Class Incremental Object Detection","date":"2025-06-10","arxiv_id":"2506.08562","n_code_links":0,"syntology":null},{"paper":"/paper/hyperspectral-image-classification-via","title":"Hyperspectral Image Classification via Transformer-based Spectral-Spatial Attention Decoupling and Adaptive Gating","date":"2025-06-10","arxiv_id":"2506.08324","n_code_links":1,"syntology":null},{"paper":null,"title":"MedMoE: Modality-Specialized Mixture of Experts for Medical Vision-Language Understanding","date":"2025-06-10","arxiv_id":"2506.08356","n_code_links":0,"syntology":null},{"paper":null,"title":"MetaTT: A Global Tensor-Train Adapter for Parameter-Efficient Fine-Tuning","date":"2025-06-10","arxiv_id":"2506.09105","n_code_links":0,"syntology":null},{"paper":"/paper/patchguard-adversarially-robust-anomaly-1","title":"PatchGuard: Adversarially Robust Anomaly Detection and Localization through Vision Transformers and Pseudo Anomalies","date":"2025-06-10","arxiv_id":"2506.09237","n_code_links":2,"syntology":null},{"paper":null,"title":"Robust Visual Localization via Semantic-Guided Multi-Scale Transformer","date":"2025-06-10","arxiv_id":"2506.08526","n_code_links":0,"syntology":null},{"paper":"/paper/tactic-translation-agents-with-cognitive","title":"TACTIC: Translation Agents with Cognitive-Theoretic Interactive Collaboration","date":"2025-06-10","arxiv_id":"2506.08403","n_code_links":1,"syntology":null},{"paper":null,"title":"4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos","date":"2025-06-09","arxiv_id":"2506.08015","n_code_links":0,"syntology":null},{"paper":null,"title":"Lightweight Sequential Transformers for Blood Glucose Level Prediction in Type-1 Diabetes","date":"2025-06-09","arxiv_id":"2506.07864","n_code_links":0,"syntology":null},{"paper":"/paper/llamarec-lkg-rag-a-single-pass-learnable","title":"LlamaRec-LKG-RAG: A Single-Pass, Learnable Knowledge Graph-RAG Framework for LLM-Based Ranking","date":"2025-06-09","arxiv_id":"2506.07449","n_code_links":1,"syntology":null},{"paper":null,"title":"LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization","date":"2025-06-09","arxiv_id":"2506.07570","n_code_links":0,"syntology":null},{"paper":null,"title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","date":"2025-06-09","arxiv_id":"2506.07999","n_code_links":0,"syntology":null},{"paper":null,"title":"Quantum Graph Transformer for NLP Sentiment Classification","date":"2025-06-09","arxiv_id":"2506.07937","n_code_links":0,"syntology":null},{"paper":null,"title":"SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding","date":"2025-06-09","arxiv_id":"2506.07600","n_code_links":0,"syntology":null},{"paper":null,"title":"Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models","date":"2025-06-08","arxiv_id":"2506.07121","n_code_links":0,"syntology":null},{"paper":null,"title":"Adam assisted Fully informed Particle Swarm Optimzation ( Adam-FIPSO ) based Parameter Prediction for the Quantum Approximate Optimization Algorithm (QAOA)","date":"2025-06-07","arxiv_id":"2506.06790","n_code_links":0,"syntology":null},{"paper":null,"title":"Breaking Data Silos: Towards Open and Scalable Mobility Foundation Models via Generative Continual Learning","date":"2025-06-07","arxiv_id":"2506.06694","n_code_links":0,"syntology":null},{"paper":null,"title":"Can In-Context Reinforcement Learning Recover From Reward Poisoning Attacks?","date":"2025-06-07","arxiv_id":"2506.06891","n_code_links":0,"syntology":null},{"paper":null,"title":"BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning","date":"2025-06-06","arxiv_id":"2506.06072","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/language-modelling","name":"Language Modelling","papers":2917},{"task":"/task/language-modeling","name":"Language Modeling","papers":2286},{"task":"/task/retrieval","name":"Retrieval","papers":1734},{"task":"/task/question-answering","name":"Question Answering","papers":1420},{"task":"/task/rag","name":"RAG","papers":1290},{"task":"/task/sentence","name":"Sentence","papers":1289},{"task":"/task/decoder","name":"Decoder","papers":1284},{"task":"/task/retrieval-augmented-generation","name":"Retrieval-augmented Generation","papers":1121},{"task":"/task/translation","name":"Translation","papers":1009},{"task":"/task/machine-translation","name":"Machine Translation","papers":905},{"task":"/task/large-language-model","name":"Large Language Model","papers":811},{"task":"/task/text-generation","name":"Text Generation","papers":723},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":707},{"task":"/task/image-classification","name":"Image Classification","papers":660},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":651},{"task":"/task/representation-learning","name":"Representation Learning","papers":596},{"task":"/task/sentiment-analysis","name":"Sentiment Analysis","papers":595},{"task":"/task/object-detection","name":"Object Detection","papers":585},{"task":"/task/text-classification","name":"Text Classification","papers":559},{"task":"/task/classification-1","name":"Classification","papers":554}],"tasks_shown":20,"n_tasks":2551,"usage_by_year":[{"year":"1986","papers":1},{"year":"2014","papers":1},{"year":"2015","papers":6},{"year":"2016","papers":23},{"year":"2017","papers":70},{"year":"2018","papers":222},{"year":"2019","papers":1198},{"year":"2020","papers":2319},{"year":"2021","papers":3153},{"year":"2022","papers":3169},{"year":"2023","papers":5041},{"year":"2024","papers":6749},{"year":"2025","papers":2438}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/adam"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}