{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mean-actor-critic","title":"Mean Actor Critic","arxiv_id":"1709.00503","date":"2017-09-01","proceeding":null,"authors":["Cameron Allen","Kavosh Asadi","Melrose Roderick","Abdel-rahman Mohamed","George Konidaris","Michael Littman"],"abstract":"We propose a new algorithm, Mean Actor-Critic (MAC), for discrete-action\ncontinuous-state reinforcement learning. MAC is a policy gradient algorithm\nthat uses the agent's explicit representation of all action values to estimate\nthe gradient of the policy, rather than using only the actions that were\nactually executed. We prove that this approach reduces variance in the policy\ngradient estimate relative to traditional actor-critic methods. We show\nempirical results on two control domains and on six Atari games, where MAC is\ncompetitive with state-of-the-art policy search algorithms.","url_abs":"http://arxiv.org/abs/1709.00503v2","url_pdf":"http://arxiv.org/pdf/1709.00503v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"mean-actor-critic","repo_url":"https://github.com/camall3n/atari-MAC","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"mean-actor-critic","repo_url":"https://github.com/kavosh8/MAC","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"atari-games","task_name":"Atari Games"},{"task_slug":"reinforcement-learning","task_name":"Reinforcement Learning"},{"task_slug":"reinforcement-learning-1","task_name":"Reinforcement Learning (RL)"},{"task_slug":"reinforcement-learning-2","task_name":"reinforcement-learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/atari-games-on-atari-2600-beam-rider","task":"Atari Games","dataset":"Atari 2600 Beam Rider","model":"MAC","rank_in_archive_order":38,"of":49,"metrics":{"Score":"6072"},"uses_additional_data":false},{"leaderboard":"/sota/atari-games-on-atari-2600-breakout","task":"Atari Games","dataset":"Atari 2600 Breakout","model":"MAC","rank_in_archive_order":30,"of":58,"metrics":{"Score":"372.7"},"uses_additional_data":false},{"leaderboard":"/sota/atari-games-on-atari-2600-pong","task":"Atari Games","dataset":"Atari 2600 Pong","model":"MAC","rank_in_archive_order":47,"of":52,"metrics":{"Score":"10.6"},"uses_additional_data":false},{"leaderboard":"/sota/atari-games-on-atari-2600-qbert","task":"Atari Games","dataset":"Atari 2600 Q*Bert","model":"MAC","rank_in_archive_order":54,"of":57,"metrics":{"Score":"243.4"},"uses_additional_data":false},{"leaderboard":"/sota/atari-games-on-atari-2600-seaquest","task":"Atari Games","dataset":"Atari 2600 Seaquest","model":"MAC","rank_in_archive_order":43,"of":57,"metrics":{"Score":"1703.4"},"uses_additional_data":false},{"leaderboard":"/sota/atari-games-on-atari-2600-space-invaders","task":"Atari Games","dataset":"Atari 2600 Space Invaders","model":"MAC","rank_in_archive_order":44,"of":55,"metrics":{"Score":"1173.1"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-cart-pole-openai-gym","task":"Continuous Control","dataset":"Cart Pole (OpenAI Gym)","model":"MAC","rank_in_archive_order":1,"of":1,"metrics":{"Score":"178.3"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-lunar-lander-openai-gym","task":"Continuous Control","dataset":"Lunar Lander (OpenAI Gym)","model":"MAC","rank_in_archive_order":5,"of":5,"metrics":{"Score":"163.5"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1709.00503","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}