{"url":"/method/maml","slug":"maml","name":"MAML","full_name":"Model-Agnostic Meta-Learning","full_name_withheld":false,"description_markdown":"**MAML**, or **Model-Agnostic Meta-Learning**, is a model and task-agnostic algorithm for meta-learning that trains a model’s parameters such that a small number of gradient updates will lead to fast learning on a new task.\r\n\r\nConsider a model represented by a parametrized function $f\\_{\\theta}$ with parameters $\\theta$. When adapting to a new task $\\mathcal{T}\\_{i}$, the model’s parameters $\\theta$ become $\\theta'\\_{i}$. With MAML, the updated parameter vector $\\theta'\\_{i}$ is computed using one or more gradient descent updates on task $\\mathcal{T}\\_{i}$. For example, when using one gradient update,\r\n\r\n$$ \\theta'\\_{i} = \\theta - \\alpha\\nabla\\_{\\theta}\\mathcal{L}\\_{\\mathcal{T}\\_{i}}\\left(f\\_{\\theta}\\right) $$\r\n\r\nThe step size $\\alpha$ may be fixed as a hyperparameter or metalearned. The model parameters are trained by optimizing for the performance of $f\\_{\\theta'\\_{i}}$ with respect to $\\theta$ across tasks sampled from $p\\left(\\mathcal{T}\\_{i}\\right)$. More concretely the meta-objective is as follows:\r\n\r\n$$ \\min\\_{\\theta} \\sum\\_{\\mathcal{T}\\_{i} \\sim p\\left(\\mathcal{T}\\right)} \\mathcal{L}\\_{\\mathcal{T\\_{i}}}\\left(f\\_{\\theta'\\_{i}}\\right) = \\sum\\_{\\mathcal{T}\\_{i} \\sim p\\left(\\mathcal{T}\\right)} \\mathcal{L}\\_{\\mathcal{T\\_{i}}}\\left(f\\_{\\theta - \\alpha\\nabla\\_{\\theta}\\mathcal{L}\\_{\\mathcal{T}\\_{i}}\\left(f\\_{\\theta}\\right)}\\right) $$\r\n\r\nNote that the meta-optimization is performed over the model parameters $\\theta$, whereas the objective is computed using the updated model parameters $\\theta'$. In effect MAML aims to optimize the model parameters such that one or a small number of gradient steps on a new task will produce maximally effective behavior on that task. The meta-optimization across tasks is performed via stochastic gradient descent ([SGD](https://paperswithcode.com/method/sgd)), such that the model parameters $\\theta$ are updated as follows:\r\n\r\n$$ \\theta \\leftarrow \\theta - \\beta\\nabla\\_{\\theta} \\sum\\_{\\mathcal{T}\\_{i} \\sim p\\left(\\mathcal{T}\\right)} \\mathcal{L}\\_{\\mathcal{T\\_{i}}}\\left(f\\_{\\theta'\\_{i}}\\right)$$\r\n\r\nwhere $\\beta$ is the meta step size.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"http://arxiv.org/abs/1703.03400v3","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/cbfinn/maml/blob/a7f45f1bcd7457fe97b227a21e89b8a82cc5fa49/maml.py#L17","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Meta-Learning Algorithms","url":"/methods/category/meta-learning-algorithms","pwc_aliases":[]}],"n_papers_tagged":232,"archive_num_papers":null,"papers_newest_first":[{"paper":null,"title":"Joint Antenna Position and Transmit Power Optimization for Pinching Antenna-Assisted ISAC Systems","date":"2025-03-17","arxiv_id":"2503.12872","n_code_links":0,"syntology":null},{"paper":null,"title":"Riemannian Geometric-based Meta Learning","date":"2025-03-14","arxiv_id":"2503.10993","n_code_links":0,"syntology":null},{"paper":null,"title":"Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01268","n_code_links":0,"syntology":null},{"paper":null,"title":"Age and Power Minimization via Meta-Deep Reinforcement Learning in UAV Networks","date":"2025-01-24","arxiv_id":"2501.14603","n_code_links":0,"syntology":null},{"paper":null,"title":"TLXML: Task-Level Explanation of Meta-Learning via Influence Functions","date":"2025-01-24","arxiv_id":"2501.14271","n_code_links":0,"syntology":null},{"paper":null,"title":"One-Class Domain Adaptation via Meta-Learning","date":"2025-01-22","arxiv_id":"2501.13052","n_code_links":0,"syntology":null},{"paper":null,"title":"Exploring the Efficacy of Meta-Learning: Unveiling Superior Data Diversity Utilization of MAML Over Pre-training","date":"2025-01-15","arxiv_id":"2501.08506","n_code_links":0,"syntology":null},{"paper":null,"title":"Memory-Reduced Meta-Learning with Guaranteed Convergence","date":"2024-12-16","arxiv_id":"2412.12030","n_code_links":0,"syntology":null},{"paper":null,"title":"Fast Adaptation with Kernel and Gradient based Meta Leaning","date":"2024-11-01","arxiv_id":"2411.00404","n_code_links":0,"syntology":null},{"paper":null,"title":"Meta-Learning-Driven Adaptive Codebook Design for Near-Field Communications","date":"2024-10-10","arxiv_id":"2410.08318","n_code_links":0,"syntology":null},{"paper":null,"title":"A New First-Order Meta-Learning Algorithm with Convergence Guarantees","date":"2024-09-05","arxiv_id":"2409.03682","n_code_links":0,"syntology":null},{"paper":"/paper/arcle-the-abstraction-and-reasoning-corpus","title":"ARCLE: The Abstraction and Reasoning Corpus Learning Environment for Reinforcement Learning","date":"2024-07-30","arxiv_id":"2407.20806","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":null,"title":"Agnostic Sharpness-Aware Minimization","date":"2024-06-11","arxiv_id":"2406.07107","n_code_links":0,"syntology":null},{"paper":"/paper/cooperative-meta-learning-with-gradient","title":"Cooperative Meta-Learning with Gradient Augmentation","date":"2024-06-07","arxiv_id":"2406.04639","n_code_links":1,"syntology":null},{"paper":null,"title":"Privacy Challenges in Meta-Learning: An Investigation on Model-Agnostic Meta-Learning","date":"2024-06-01","arxiv_id":"2406.00249","n_code_links":0,"syntology":null},{"paper":null,"title":"MAML MOT: Multiple Object Tracking based on Meta-Learning","date":"2024-05-12","arxiv_id":"2405.07272","n_code_links":0,"syntology":null},{"paper":null,"title":"Lasso Ridge based XGBoost and Deep_LSTM Help Tennis Players Perform better","date":"2024-05-11","arxiv_id":"2405.07030","n_code_links":0,"syntology":null},{"paper":"/paper/evaluating-fast-adaptability-of-neural","title":"Evaluating Fast Adaptability of Neural Networks for Brain-Computer Interface","date":"2024-04-14","arxiv_id":"2404.15350","n_code_links":1,"syntology":null},{"paper":null,"title":"Learning-to-Learn the Wave Angle Estimation","date":"2024-03-21","arxiv_id":"2403.14306","n_code_links":0,"syntology":null},{"paper":"/paper/zero-shot-ecg-classification-with-multimodal","title":"Zero-Shot ECG Classification with Multimodal Learning and Test-time Clinical Knowledge Enhancement","date":"2024-03-11","arxiv_id":"2403.06659","n_code_links":2,"syntology":{"ran":8,"of":12,"unverified":4,"pointer_only":0}},{"paper":"/paper/decomposed-meta-learning-for-few-shot","title":"Decomposed Meta-Learning for Few-Shot Sequence Labeling","date":"2024-03-04","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"title":"FORML: A Riemannian Hessian-free Method for Meta-learning on Stiefel Manifolds","date":"2024-02-28","arxiv_id":"2402.18605","n_code_links":0,"syntology":null},{"paper":null,"title":"Jointly Learning Representations for Map Entities via Heterogeneous Graph Contrastive Learning","date":"2024-02-09","arxiv_id":"2402.06135","n_code_links":0,"syntology":null},{"paper":"/paper/predicting-configuration-performance-in","title":"Predicting Configuration Performance in Multiple Environments with Sequential Meta-learning","date":"2024-02-05","arxiv_id":"2402.03183","n_code_links":1,"syntology":null},{"paper":null,"title":"Rethinking the Starting Point: Collaborative Pre-Training for Federated Downstream Tasks","date":"2024-02-03","arxiv_id":"2402.02225","n_code_links":0,"syntology":null},{"paper":null,"title":"DK-SLAM: Monocular Visual SLAM with Deep Keypoint Learning, Tracking and Loop-Closing","date":"2024-01-17","arxiv_id":"2401.09160","n_code_links":0,"syntology":null},{"paper":null,"title":"Any-Way Meta Learning","date":"2024-01-10","arxiv_id":"2401.05097","n_code_links":0,"syntology":null},{"paper":"/paper/are-lstms-good-few-shot-learners","title":"Are LSTMs Good Few-Shot Learners?","date":"2023-10-22","arxiv_id":"2310.14139","n_code_links":1,"syntology":null},{"paper":"/paper/understanding-transfer-learning-and-gradient","title":"Understanding Transfer Learning and Gradient-Based Meta-Learning Techniques","date":"2023-10-09","arxiv_id":"2310.06148","n_code_links":1,"syntology":null},{"paper":null,"title":"Task Aware Modulation using Representation Learning: An Approach for Few Shot Learning in Environmental Systems","date":"2023-10-07","arxiv_id":"2310.04727","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/meta-learning","name":"Meta-Learning","papers":208},{"task":"/task/few-shot-learning","name":"Few-Shot Learning","papers":71},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":23},{"task":"/task/image-classification","name":"Image Classification","papers":22},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":21},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":20},{"task":"/task/image-classification","name":"image-classification","papers":20},{"task":"/task/few-shot-image-classification","name":"Few-Shot Image Classification","papers":17},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":17},{"task":"/task/classification","name":"General Classification","papers":16},{"task":"/task/classification-1","name":"Classification","papers":12},{"task":"/task/diversity","name":"Diversity","papers":11},{"task":"/task/federated-learning","name":"Federated Learning","papers":11},{"task":"/task/model","name":"model","papers":11},{"task":"/task/meta-reinforcement-learning","name":"Meta Reinforcement Learning","papers":9},{"task":"/task/representation-learning","name":"Representation Learning","papers":9},{"task":"/task/domain-adaptation","name":"Domain Adaptation","papers":7},{"task":"/task/regression-1","name":"regression","papers":7},{"task":"/task/continual-learning","name":"Continual Learning","papers":6},{"task":"/task/language-modeling","name":"Language Modeling","papers":6}],"tasks_shown":20,"n_tasks":218,"usage_by_year":[{"year":"2017","papers":2},{"year":"2018","papers":11},{"year":"2019","papers":27},{"year":"2020","papers":45},{"year":"2021","papers":61},{"year":"2022","papers":39},{"year":"2023","papers":20},{"year":"2024","papers":20},{"year":"2025","papers":7}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/maml"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}