{"url":"/method/dpg","slug":"dpg","name":"DPG","full_name":"Deterministic Policy Gradient","full_name_withheld":false,"description_markdown":"**Deterministic Policy Gradient**, or **DPG**, is a policy gradient method for reinforcement learning. Instead of the policy function $\\pi\\left(.\\mid{s}\\right)$ being modeled as a probability distribution, DPG considers and calculates gradients for a deterministic policy $a = \\mu\\_{theta}\\left(s\\right)$.","description_state":"present","introduced_year":2014,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Policy Gradient Methods","url":"/methods/category/policy-gradient-methods","pwc_aliases":[]}],"n_papers_tagged":20,"archive_num_papers":20,"papers_newest_first":[{"paper":null,"title":"DPG loss functions for learning parameter-to-solution maps by neural networks","date":"2025-06-23","arxiv_id":"2506.18773","n_code_links":0,"syntology":null},{"paper":"/paper/reasongen-r1-cot-for-autoregressive-image","title":"ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL","date":"2025-05-30","arxiv_id":"2505.24875","n_code_links":1,"syntology":{"ran":5,"of":13,"unverified":8,"pointer_only":0}},{"paper":null,"title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","date":"2025-05-21","arxiv_id":"2505.15172","n_code_links":0,"syntology":null},{"paper":null,"title":"DIP-Watermark: A Double Identity Protection Method Based on Robust Adversarial Watermark","date":"2024-04-23","arxiv_id":"2404.14693","n_code_links":0,"syntology":null},{"paper":"/paper/dynamic-generation-of-personalities-with","title":"Dynamic Generation of Personalities with Large Language Models","date":"2024-04-10","arxiv_id":"2404.07084","n_code_links":1,"syntology":null},{"paper":null,"title":"Decision Predicate Graphs: Enhancing Interpretability in Tree Ensembles","date":"2024-04-03","arxiv_id":"2404.02942","n_code_links":0,"syntology":null},{"paper":null,"title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","date":"2024-02-04","arxiv_id":"2402.02479","n_code_links":0,"syntology":null},{"paper":null,"title":"Dual-based Online Learning of Dynamic Network Topologies","date":"2022-11-14","arxiv_id":"2211.07449","n_code_links":0,"syntology":null},{"paper":null,"title":"Dynamic Sparse R-CNN","date":"2022-05-04","arxiv_id":"2205.02101","n_code_links":0,"syntology":null},{"paper":"/paper/controlling-conditional-language-models-with","title":"Controlling Conditional Language Models without Catastrophic Forgetting","date":"2021-12-01","arxiv_id":"2112.00791","n_code_links":2,"syntology":{"ran":3,"of":8,"unverified":5,"pointer_only":4}},{"paper":null,"title":"MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles","date":"2021-06-16","arxiv_id":"2106.08634","n_code_links":0,"syntology":null},{"paper":"/paper/deep-reinforcement-agent-for-scheduling-in","title":"Deep Reinforcement Agent for Scheduling in HPC","date":"2021-02-11","arxiv_id":"2102.06243","n_code_links":1,"syntology":null},{"paper":null,"title":"A review of motion planning algorithms for intelligent robotics","date":"2021-02-04","arxiv_id":"2102.02376","n_code_links":0,"syntology":null},{"paper":"/paper/offcon-3-what-is-state-of-the-art-anyway","title":"OffCon$^3$: What is state of the art anyway?","date":"2021-01-27","arxiv_id":"2101.11331","n_code_links":1,"syntology":null},{"paper":null,"title":"Zeroth-order Deterministic Policy Gradient","date":"2020-06-12","arxiv_id":"2006.07314","n_code_links":0,"syntology":null},{"paper":null,"title":"Investigation on the generalization of the Sampled Policy Gradient algorithm","date":"2019-10-09","arxiv_id":"1910.03728","n_code_links":0,"syntology":null},{"paper":"/paper/sampled-policy-gradient-for-learning-to-play","title":"Sampled Policy Gradient for Learning to Play the Game Agar.io","date":"2018-09-15","arxiv_id":"1809.05763","n_code_links":2,"syntology":null},{"paper":null,"title":"Directed Policy Gradient for Safe Reinforcement Learning with Human Advice","date":"2018-08-13","arxiv_id":"1808.04096","n_code_links":0,"syntology":null},{"paper":null,"title":"Deterministic Policy Gradients With General State Transitions","date":"2018-07-10","arxiv_id":"1807.03708","n_code_links":0,"syntology":null},{"paper":null,"title":"Expected Policy Gradients","date":"2017-06-15","arxiv_id":"1706.05374","n_code_links":0,"syntology":null}],"papers_shown":20,"tasks":[{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":4},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":4},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":3},{"task":"/task/continuous-control","name":"Continuous Control","papers":2},{"task":"/task/image-generation","name":"Image Generation","papers":2},{"task":"/task/language-modeling","name":"Language Modeling","papers":2},{"task":"/task/language-modelling","name":"Language Modelling","papers":2},{"task":"/task/q-learning","name":"Q-Learning","papers":2},{"task":"/task/continuous-control","name":"continuous-control","papers":2},{"task":"/task/abstractive-text-summarization","name":"Abstractive Text Summarization","papers":1},{"task":"/task/adversarial-attack","name":"Adversarial Attack","papers":1},{"task":"/task/code-generation","name":"Code Generation","papers":1},{"task":"/task/decoder","name":"Decoder","papers":1},{"task":"/task/deep-reinforcement-learning","name":"Deep Reinforcement Learning","papers":1},{"task":"/task/face-recognition","name":"Face Recognition","papers":1},{"task":"/task/game-design","name":"Game Design","papers":1},{"task":"/task/model-predictive-control","name":"Model Predictive Control","papers":1},{"task":"/task/motion-planning","name":"Motion Planning","papers":1},{"task":"/task/mujoco","name":"MuJoCo","papers":1},{"task":"/task/object-detection","name":"Object Detection","papers":1}],"tasks_shown":20,"n_tasks":28,"usage_by_year":[{"year":"2017","papers":1},{"year":"2018","papers":3},{"year":"2019","papers":1},{"year":"2020","papers":1},{"year":"2021","papers":5},{"year":"2022","papers":2},{"year":"2024","papers":4},{"year":"2025","papers":3}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/dpg"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}