{"url":"/task/policy-gradient-methods","name":"Policy Gradient Methods","slug":"policy-gradient-methods","description_markdown":null,"categories":[{"name":"Methodology","url":"/area/methodology"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":382,"papers_with_code":103,"benchmarks":0,"benchmark_tables_in_archive":0,"benchmark_tables_shown":0,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":2,"subtasks":0,"parent_tasks":0},"benchmarks":[],"datasets":[{"url":"/dataset/hanabi-learning-environment","name":"Hanabi Learning Environment","full_name":"","num_papers_in_archive":10},{"url":"/dataset/rllab-framework","name":"RLLab Framework","full_name":"","num_papers_in_archive":1}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":103,"tagged_in_all":382,"items":[{"url":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","arxiv_id":"1707.06347","repositories_listed":188,"syntology":{"n":176,"n_ran":99,"n_unverified":77,"n_pointer_only":94}},{"url":"/paper/self-critical-sequence-training-for-image","title":"Self-critical Sequence Training for Image Captioning","date":"2016-12-02","arxiv_id":"1612.00563","repositories_listed":31,"syntology":{"n":13,"n_ran":8,"n_unverified":5,"n_pointer_only":3}},{"url":"/paper/trust-region-policy-optimization","title":"Trust Region Policy Optimization","date":"2015-02-19","arxiv_id":"1502.05477","repositories_listed":24,"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":7}},{"url":"/paper/high-dimensional-continuous-control-using","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","date":"2015-06-08","arxiv_id":"1506.02438","repositories_listed":17,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":1}},{"url":"/paper/deep-reinforcement-learning-for-dialogue","title":"Deep Reinforcement Learning for Dialogue Generation","date":"2016-06-05","arxiv_id":"1606.01541","repositories_listed":8,"syntology":null},{"url":"/paper/competitive-policy-optimization","title":"Competitive Policy Optimization","date":"2020-06-18","arxiv_id":"2006.10611","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":1}},{"url":"/paper/is-reinforcement-learning-not-for-natural","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","date":"2022-10-03","arxiv_id":"2210.01241","repositories_listed":3,"syntology":null},{"url":"/paper/distributional-policy-optimization-an","title":"Distributional Policy Optimization: An Alternative Approach for Continuous Control","date":"2019-05-23","arxiv_id":"1905.09855","repositories_listed":3,"syntology":null},{"url":"/paper/rethinking-action-spaces-for-reinforcement","title":"Rethinking Action Spaces for Reinforcement Learning in End-to-end Dialog Agents with Latent Variable Models","date":"2019-02-23","arxiv_id":"1902.08858","repositories_listed":3,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/reevaluating-policy-gradient-methods-for","title":"Reevaluating Policy Gradient Methods for Imperfect-Information Games","date":"2025-02-13","arxiv_id":"2502.08938","repositories_listed":2,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/policy-gradient-methods-in-the-presence-of","title":"Policy Gradient Methods in the Presence of Symmetries and State Abstractions","date":"2023-05-09","arxiv_id":"2305.05666","repositories_listed":2,"syntology":null},{"url":"/paper/experimental-design-for-mri-by-greedy-policy","title":"Experimental design for MRI by greedy policy search","date":"2020-10-30","arxiv_id":"2010.16262","repositories_listed":2,"syntology":{"n":18,"n_ran":4,"n_unverified":14,"n_pointer_only":0}},{"url":"/paper/lifelong-policy-gradient-learning-of-factored","title":"Lifelong Policy Gradient Learning of Factored Policies for Faster Training Without Forgetting","date":"2020-07-14","arxiv_id":"2007.07011","repositories_listed":2,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/deep-reinforcement-learning-algorithm-for","title":"Deep Reinforcement Learning Algorithm for Dynamic Pricing of Express Lanes with Multiple Access Locations","date":"2019-09-10","arxiv_id":"1909.04760","repositories_listed":2,"syntology":null},{"url":"/paper/rethink-global-reward-game-and-credit","title":"Shapley Q-value: A Local Reward Approach to Solve Global Reward Games","date":"2019-07-11","arxiv_id":"1907.05707","repositories_listed":2,"syntology":{"n":3,"n_ran":1,"n_unverified":2,"n_pointer_only":3}},{"url":"/paper/explainable-knowledge-graph-based","title":"Ekar: An Explainable Method for Knowledge Aware Recommendation","date":"2019-06-22","arxiv_id":"1906.09506","repositories_listed":2,"syntology":null},{"url":"/paper/trajectory-based-off-policy-deep","title":"Trajectory-Based Off-Policy Deep Reinforcement Learning","date":"2019-05-14","arxiv_id":"1905.05710","repositories_listed":2,"syntology":null},{"url":"/paper/on-policy-trust-region-policy-optimisation","title":"On-Policy Trust Region Policy Optimisation with Replay Buffers","date":"2019-01-18","arxiv_id":"1901.06212","repositories_listed":2,"syntology":null},{"url":"/paper/remember-and-forget-for-experience-replay","title":"Remember and Forget for Experience Replay","date":"2018-07-16","arxiv_id":"1807.05827","repositories_listed":2,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/improving-exploration-in-evolution-strategies","title":"Improving Exploration in Evolution Strategies for Deep Reinforcement Learning via a Population of Novelty-Seeking Agents","date":"2017-12-18","arxiv_id":"1712.06560","repositories_listed":2,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":3}},{"url":"/paper/action-depedent-control-variates-for-policy","title":"Action-depedent Control Variates for Policy Optimization via Stein's Identity","date":"2017-10-30","arxiv_id":"1710.11198","repositories_listed":2,"syntology":{"n":7,"n_ran":0,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/q-prop-sample-efficient-policy-gradient-with","title":"Q-Prop: Sample-Efficient Policy Gradient with An Off-Policy Critic","date":"2016-11-07","arxiv_id":"1611.02247","repositories_listed":2,"syntology":null},{"url":"/paper/direct-retrieval-augmented-optimization","title":"Direct Retrieval-augmented Optimization: Synergizing Knowledge Selection and Language Models","date":"2025-05-05","arxiv_id":"2505.03075","repositories_listed":1,"syntology":null},{"url":"/paper/hierarchical-policy-gradient-reinforcement","title":"Hierarchical Policy-Gradient Reinforcement Learning for Multi-Agent Shepherding Control of Non-Cohesive Targets","date":"2025-04-03","arxiv_id":"2504.02479","repositories_listed":1,"syntology":null},{"url":"/paper/convergence-guarantees-of-model-free-policy","title":"Convergence Guarantees of Model-free Policy Gradient Methods for LQR with Stochastic Data","date":"2025-02-27","arxiv_id":"2502.19977","repositories_listed":1,"syntology":null},{"url":"/paper/fine-tuning-discrete-diffusion-models-with","title":"Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods","date":"2025-02-03","arxiv_id":"2502.01384","repositories_listed":1,"syntology":{"n":8,"n_ran":1,"n_unverified":7,"n_pointer_only":0}},{"url":"/paper/divergence-augmented-policy-optimization-1","title":"Divergence-Augmented Policy Optimization","date":"2025-01-25","arxiv_id":"2501.15034","repositories_listed":1,"syntology":null},{"url":"/paper/an-attentive-graph-agent-for-topology","title":"An Attentive Graph Agent for Topology-Adaptive Cyber Defence","date":"2025-01-24","arxiv_id":"2501.14700","repositories_listed":1,"syntology":null},{"url":"/paper/multilinear-tensor-low-rank-approximation-for","title":"Multilinear Tensor Low-Rank Approximation for Policy-Gradient Methods in Reinforcement Learning","date":"2025-01-08","arxiv_id":"2501.04879","repositories_listed":1,"syntology":null},{"url":"/paper/reinforcement-learning-an-overview","title":"Reinforcement Learning: An Overview","date":"2024-12-06","arxiv_id":"2412.05265","repositories_listed":1,"syntology":null}],"syntology_records":14,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}