{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/value-decomposition-networks-for-cooperative","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","arxiv_id":"1706.05296","date":"2017-06-16","proceeding":null,"authors":["Peter Sunehag","Guy Lever","Audrunas Gruslys","Wojciech Marian Czarnecki","Vinicius Zambaldi","Max Jaderberg","Marc Lanctot","Nicolas Sonnerat","Joel Z. Leibo","Karl Tuyls","Thore Graepel"],"abstract":"We study the problem of cooperative multi-agent reinforcement learning with a\nsingle joint reward signal. This class of learning problems is difficult\nbecause of the often large combined action and observation spaces. In the fully\ncentralized and decentralized approaches, we find the problem of spurious\nrewards and a phenomenon we call the \"lazy agent\" problem, which arises due to\npartial observability. We address these problems by training individual agents\nwith a novel value decomposition network architecture, which learns to\ndecompose the team value function into agent-wise value functions. We perform\nan experimental evaluation across a range of partially-observable multi-agent\ndomains and show that learning such value-decompositions leads to superior\nresults, in particular when combined with weight sharing, role information and\ninformation channels.","url_abs":"http://arxiv.org/abs/1706.05296v1","url_pdf":"http://arxiv.org/pdf/1706.05296v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/Louiii/ValueDecomposition","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"unanswered"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/TonghanWang/DOP","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/TonghanWang/NDQ","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/cathyhxh/ctds","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/facebookresearch/benchmarl","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/hhhusiyi-monash/UPDeT","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/jjbong/strangeness_exploration","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/jugg1er/air","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/puyuan1996/MARL","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null},{"paper_slug":"value-decomposition-networks-for-cooperative","repo_url":"https://github.com/tjuhaoxiaotian/pymarl3","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"multi-agent-reinforcement-learning","task_name":"Multi-agent Reinforcement Learning"},{"task_slug":"reinforcement-learning","task_name":"Reinforcement Learning"},{"task_slug":"reinforcement-learning-1","task_name":"Reinforcement Learning (RL)"},{"task_slug":"smac-1","task_name":"SMAC+"},{"task_slug":"reinforcement-learning-2","task_name":"reinforcement-learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/smac-on-smac-def-armored-parallel","task":"SMAC+","dataset":"Def_Armored_parallel","model":"VDN","rank_in_archive_order":5,"of":10,"metrics":{"Median Win Rate":"5.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-def-armored-sequential","task":"SMAC+","dataset":"Def_Armored_sequential","model":"VDN","rank_in_archive_order":2,"of":11,"metrics":{"Median Win Rate":"96.9"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-def-infantry-parallel","task":"SMAC+","dataset":"Def_Infantry_parallel","model":"VDN","rank_in_archive_order":4,"of":10,"metrics":{"Median Win Rate":"95.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-def-infantry-sequential","task":"SMAC+","dataset":"Def_Infantry_sequential","model":"VDN","rank_in_archive_order":6,"of":11,"metrics":{"Median Win Rate":"96.9"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-def-outnumbered-parallel","task":"SMAC+","dataset":"Def_Outnumbered_parallel","model":"VDN","rank_in_archive_order":8,"of":10,"metrics":{"Median Win Rate":"0.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-def-outnumbered-sequential","task":"SMAC+","dataset":"Def_Outnumbered_sequential","model":"VDN","rank_in_archive_order":4,"of":11,"metrics":{"Median Win Rate":"15.6"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-off-complicated-parallel","task":"SMAC+","dataset":"Off_Complicated_parallel","model":"VDN","rank_in_archive_order":2,"of":10,"metrics":{"Median Win Rate":"70.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-off-distant-parallel","task":"SMAC+","dataset":"Off_Distant_parallel","model":"VDN","rank_in_archive_order":2,"of":10,"metrics":{"Median Win Rate":"85.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-off-hard-parallel","task":"SMAC+","dataset":"Off_Hard_parallel","model":"VDN","rank_in_archive_order":2,"of":10,"metrics":{"Median Win Rate":"15.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-off-near-parallel","task":"SMAC+","dataset":"Off_Near_parallel","model":"VDN","rank_in_archive_order":3,"of":10,"metrics":{"Median Win Rate":"90.0"},"uses_additional_data":false},{"leaderboard":"/sota/smac-on-smac-off-superhard-parallel","task":"SMAC+","dataset":"Off_Superhard_parallel","model":"VDN","rank_in_archive_order":6,"of":10,"metrics":{"Median Win Rate":"0.0"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1706.05296","atlas_url":"https://app.syntology.ai/?focus=1706.05296","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}