{"url":"/method/mdpo","slug":"mdpo","name":"MDPO","full_name":"Mirror Descent Policy Optimization","full_name_withheld":false,"description_markdown":"**Mirror Descent Policy Optimization (MDPO)** is a policy gradient algorithm based on the idea of iteratively solving a trust-region problem that minimizes a sum of two terms: a linearization of the standard RL objective function and a proximity term that restricts two consecutive updates to be close to each other. It is based on Mirror Descent, which is a general trust region method that\r\nattempts to keep consecutive iterates close to each other.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Mirror Descent Policy Optimization","paper":"/paper/mirror-descent-policy-optimization","first_author":"Manan Tomar","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/mirror-descent-policy-optimization"},"source":{"url":"https://arxiv.org/abs/2005.09814v5","title":"Mirror Descent Policy Optimization","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Policy Gradient Methods","url":"/methods/category/policy-gradient-methods","pwc_aliases":[]}],"n_papers_tagged":4,"archive_num_papers":4,"papers_newest_first":[{"paper":null,"title":"Fast Convergence of Softmax Policy Mirror Ascent","date":"2024-11-18","arxiv_id":"2411.12042","n_code_links":0,"syntology":null},{"paper":"/paper/mdpo-conditional-preference-optimization-for","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","date":"2024-06-17","arxiv_id":"2406.11839","n_code_links":1,"syntology":{"ran":5,"of":10,"unverified":5,"pointer_only":10}},{"paper":null,"title":"Model-Based Decentralized Policy Optimization","date":"2023-02-16","arxiv_id":"2302.08139","n_code_links":0,"syntology":null},{"paper":"/paper/mirror-descent-policy-optimization","title":"Mirror Descent Policy Optimization","date":"2020-05-20","arxiv_id":"2005.09814","n_code_links":1,"syntology":null}],"papers_shown":4,"tasks":[{"task":"/task/continuous-control","name":"Continuous Control","papers":1},{"task":"/task/hallucination","name":"Hallucination","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/large-language-model","name":"Large Language Model","papers":1},{"task":"/task/mujoco","name":"MuJoCo","papers":1},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":1},{"task":"/task/continuous-control","name":"continuous-control","papers":1},{"task":"/task/model","name":"model","papers":1}],"tasks_shown":9,"n_tasks":9,"usage_by_year":[{"year":"2020","papers":1},{"year":"2023","papers":1},{"year":"2024","papers":2}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/mdpo"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}