{"url":"/method/maddpg","slug":"maddpg","name":"MADDPG","full_name":"MADDPG","full_name_withheld":false,"description_markdown":"**MADDPG**, or **Multi-agent DDPG**, extends [DDPG](https://paperswithcode.com/method/ddpg) into a multi-agent policy gradient algorithm where decentralized agents learn a centralized critic based on the observations and actions of all agents. It leads to learned policies that only use local information (i.e. their own observations) at execution time, does not assume a differentiable model of the environment dynamics or any particular structure on the communication method between agents, and is applicable not only to cooperative interaction but to competitive or mixed interaction involving both physical and communicative behavior. The critic is augmented with extra information about the policies of other agents, while the actor only has access to local information. After training is completed, only the local actors are used at execution phase, acting in a decentralized manner.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","paper":"/paper/multi-agent-actor-critic-for-mixed","first_author":"Ryan Lowe","n_authors":6,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/multi-agent-actor-critic-for-mixed"},"source":{"url":"https://arxiv.org/abs/1706.02275v4","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Policy Gradient Methods","url":"/methods/category/policy-gradient-methods","pwc_aliases":[]}],"n_papers_tagged":36,"archive_num_papers":36,"papers_newest_first":[{"paper":null,"title":"Fully-Decentralized MADDPG with Networked Agents","date":"2025-03-09","arxiv_id":"2503.06747","n_code_links":0,"syntology":null},{"paper":null,"title":"Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization","date":"2024-08-08","arxiv_id":"2408.04251","n_code_links":0,"syntology":null},{"paper":null,"title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","n_code_links":0,"syntology":null},{"paper":"/paper/combinatorial-client-master-multiagent-deep","title":"Combinatorial Client-Master Multiagent Deep Reinforcement Learning for Task Offloading in Mobile Edge Computing","date":"2024-02-18","arxiv_id":"2402.11653","n_code_links":2,"syntology":null},{"paper":null,"title":"Privacy Preserving Multi-Agent Reinforcement Learning in Supply Chains","date":"2023-12-09","arxiv_id":"2312.05686","n_code_links":0,"syntology":null},{"paper":null,"title":"Adaptive Resource Management for Edge Network Slicing using Incremental Multi-Agent Deep Reinforcement Learning","date":"2023-10-26","arxiv_id":"2310.17523","n_code_links":0,"syntology":null},{"paper":null,"title":"Safe Hierarchical Reinforcement Learning for CubeSat Task Scheduling Based on Energy Consumption","date":"2023-09-21","arxiv_id":"2309.12004","n_code_links":0,"syntology":null},{"paper":"/paper/progression-cognition-reinforcement-learning","title":"Progression Cognition Reinforcement Learning with Prioritized Experience for Multi-Vehicle Pursuit","date":"2023-06-08","arxiv_id":"2306.05016","n_code_links":1,"syntology":null},{"paper":null,"title":"Reinforcement Learning With Reward Machines in Stochastic Games","date":"2023-05-27","arxiv_id":"2305.17372","n_code_links":0,"syntology":null},{"paper":"/paper/revisiting-the-gumbel-softmax-in-maddpg","title":"Revisiting the Gumbel-Softmax in MADDPG","date":"2023-02-23","arxiv_id":"2302.11793","n_code_links":1,"syntology":null},{"paper":null,"title":"On Multi-Agent Deep Deterministic Policy Gradients and their Explainability for SMARTS Environment","date":"2023-01-20","arxiv_id":"2301.09420","n_code_links":0,"syntology":null},{"paper":"/paper/multiagent-reinforcement-learning-based-on","title":"Multiagent Reinforcement Learning Based on Fusion-Multiactor-Attention-Critic for Multiple-Unmanned-Aerial-Vehicle Navigation Control","date":"2022-10-10","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"title":"A New Approach to Training Multiple Cooperative Agents for Autonomous Driving","date":"2022-09-05","arxiv_id":"2209.02157","n_code_links":0,"syntology":null},{"paper":null,"title":"Two-Hop Age of Information Scheduling for Multi-UAV Assisted Mobile Edge Computing: FRL vs MADDPG","date":"2022-06-19","arxiv_id":"2206.09488","n_code_links":0,"syntology":null},{"paper":null,"title":"Balancing Profit, Risk, and Sustainability for Portfolio Management","date":"2022-06-06","arxiv_id":"2207.02134","n_code_links":0,"syntology":null},{"paper":null,"title":"MA-Dreamer: Coordination and communication through shared imagination","date":"2022-04-10","arxiv_id":"2204.04687","n_code_links":0,"syntology":null},{"paper":null,"title":"Decision-making of Emergent Incident based on P-MADDPG","date":"2022-03-19","arxiv_id":"2203.12673","n_code_links":0,"syntology":null},{"paper":null,"title":"Learning to Infer Belief Embedded Communication","date":"2022-03-15","arxiv_id":"2203.07832","n_code_links":0,"syntology":null},{"paper":null,"title":"Decentralized Multi-Agent Reinforcement Learning: An Off-Policy Method","date":"2021-10-31","arxiv_id":"2111.00438","n_code_links":0,"syntology":null},{"paper":"/paper/trust-region-policy-optimisation-in-multi","title":"Trust Region Policy Optimisation in Multi-Agent Reinforcement Learning","date":"2021-09-23","arxiv_id":"2109.11251","n_code_links":11,"syntology":{"ran":2,"of":5,"unverified":3,"pointer_only":0}},{"paper":"/paper/macrpo-multi-agent-cooperative-recurrent","title":"MACRPO: Multi-Agent Cooperative Recurrent Policy Optimization","date":"2021-09-02","arxiv_id":"2109.00882","n_code_links":1,"syntology":null},{"paper":null,"title":"A Deep Reinforcement Learning Approach for Traffic Signal Control Optimization","date":"2021-07-13","arxiv_id":"2107.06115","n_code_links":0,"syntology":null},{"paper":null,"title":"Many Agent Reinforcement Learning Under Partial Observability","date":"2021-06-17","arxiv_id":"2106.09825","n_code_links":0,"syntology":null},{"paper":null,"title":"Hierarchical RNNs-Based Transformers MADDPG for Mixed Cooperative-Competitive Environments","date":"2021-05-11","arxiv_id":"2105.04888","n_code_links":0,"syntology":null},{"paper":null,"title":"Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games","date":"2020-11-23","arxiv_id":"2011.11517","n_code_links":0,"syntology":null},{"paper":null,"title":"Human and Multi-Agent collaboration in a human-MARL teaming framework","date":"2020-06-12","arxiv_id":"2006.07301","n_code_links":0,"syntology":null},{"paper":null,"title":"Experience Augmentation: Boosting and Accelerating Off-Policy Multi-Agent Reinforcement Learning","date":"2020-05-19","arxiv_id":"2005.09453","n_code_links":0,"syntology":null},{"paper":null,"title":"Multi-Agent Reinforcement Learning for Problems with Combined Individual and Team Reward","date":"2020-03-24","arxiv_id":"2003.10598","n_code_links":0,"syntology":null},{"paper":"/paper/evolutionary-population-curriculum-for-1","title":"Evolutionary Population Curriculum for Scaling Multi-Agent Reinforcement Learning","date":"2020-03-23","arxiv_id":"2003.10423","n_code_links":1,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}},{"paper":"/paper/deep-multi-agent-reinforcement-learning-for","title":"FACMAC: Factored Multi-Agent Centralised Policy Gradients","date":"2020-03-14","arxiv_id":"2003.06709","n_code_links":3,"syntology":{"ran":1,"of":4,"unverified":3,"pointer_only":0}}],"papers_shown":30,"tasks":[{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":25},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":20},{"task":"/task/multi-agent-reinforcement-learning","name":"Multi-agent Reinforcement Learning","papers":19},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":19},{"task":"/task/deep-reinforcement-learning","name":"Deep Reinforcement Learning","papers":10},{"task":"/task/q-learning","name":"Q-Learning","papers":8},{"task":"/task/edge-computing","name":"Edge-computing","papers":3},{"task":"/task/mujoco","name":"MuJoCo","papers":3},{"task":"/task/policy-gradient-methods","name":"Policy Gradient Methods","papers":3},{"task":"/task/scheduling","name":"Scheduling","papers":3},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":2},{"task":"/task/decision-making","name":"Decision Making","papers":2},{"task":"/task/management","name":"Management","papers":2},{"task":"/task/autonomous-vehicles","name":"Autonomous Vehicles","papers":1},{"task":"/task/benchmarking","name":"Benchmarking","papers":1},{"task":"/task/continual-learning","name":"Continual Learning","papers":1},{"task":"/task/continuous-control","name":"Continuous Control","papers":1},{"task":"/task/face-recognition","name":"Face Recognition","papers":1},{"task":"/task/hierarchical-reinforcement-learning","name":"Hierarchical Reinforcement Learning","papers":1},{"task":"/task/incremental-learning","name":"Incremental Learning","papers":1}],"tasks_shown":20,"n_tasks":36,"usage_by_year":[{"year":"2017","papers":1},{"year":"2018","papers":3},{"year":"2019","papers":2},{"year":"2020","papers":6},{"year":"2021","papers":6},{"year":"2022","papers":7},{"year":"2023","papers":7},{"year":"2024","papers":3},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/maddpg"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}