{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/bayesian-policy-gradients-via-alpha","title":"Bayesian Policy Gradients via Alpha Divergence Dropout Inference","arxiv_id":"1712.02037","date":"2017-12-06","proceeding":null,"authors":["Peter Henderson","Thang Doan","Riashat Islam","David Meger"],"abstract":"Policy gradient methods have had great success in solving continuous control\ntasks, yet the stochastic nature of such problems makes deterministic value\nestimation difficult. We propose an approach which instead estimates a\ndistribution by fitting the value function with a Bayesian Neural Network. We\noptimize an $\\alpha$-divergence objective with Bayesian dropout approximation\nto learn and estimate this distribution. We show that using the Monte Carlo\nposterior mean of the Bayesian value function distribution, rather than a\ndeterministic network, improves stability and performance of policy gradient\nmethods in continuous control MuJoCo simulations.","url_abs":"http://arxiv.org/abs/1712.02037v1","url_pdf":"http://arxiv.org/pdf/1712.02037v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"bayesian-policy-gradients-via-alpha","repo_url":"https://github.com/Breakend/BayesianPolicyGradients","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"tf","reach":null}],"tasks":[{"task_slug":"continuous-control","task_name":"Continuous Control"},{"task_slug":"mujoco","task_name":"MuJoCo"},{"task_slug":"policy-gradient-methods","task_name":"Policy Gradient Methods"},{"task_slug":"continuous-control","task_name":"continuous-control"}],"methods":[{"method_slug":"dropout","method_name":"Dropout"}],"datasets_introduced":[],"methods_introduced":[],"results":[],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}