Browse State-of-the-Art › Policy Gradient Methods › Papers, page 2
Policy Gradient Methods
Papers archive 2025-07-28
archive papers tagged: 382 · with a code link: 103 · where Syntology ran a sample: 33 (32 with a run with no instrument failure, 1 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (33 of 382 tagged: 32 with a run with no instrument failure, 1 where every run was a failure of Syntology's instrument)
Page 2 of 4: papers 101 to 200 of 382, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
27 Sep 2017 1 repository listed
-
10 Aug 2017 1 repository listed
-
1 Nov 2016 1 repository listed
-
Improving DAPO from a Mixed-Policy Perspective17 Jul 2025 0 repositories listed
-
Local Pairwise Distance Matching for Backpropagation-Free Reinforcement Learning15 Jul 2025 0 repositories listed
-
Solving Zero-Sum Convex Markov Games19 Jun 2025 0 repositories listed
-
Enhanced DACER Algorithm with High Diffusion Efficiency29 May 2025 0 repositories listed
-
Equivalence of stochastic and deterministic policy gradients29 May 2025 0 repositories listed
-
On Global Convergence Rates for Federated Policy Gradient under Heterogeneous Environment29 May 2025 0 repositories listed
-
Learning from Algorithm Feedback: One-Shot SAT Solver Guidance with GNNs21 May 2025 0 repositories listed
-
Policy Testing in Markov Decision Processes21 May 2025 0 repositories listed
-
KIPPO: Koopman-Inspired Proximal Policy Optimization20 May 2025 0 repositories listed
-
Self-Evolving Curriculum for LLM Reasoning20 May 2025 0 repositories listed
-
Token-Efficient RL for LLM Reasoning29 Apr 2025 0 repositories listed
-
Evolutionary Policy Optimization17 Apr 2025 0 repositories listed
-
Ordering-based Conditions for Global Convergence of Policy Gradient Methods2 Apr 2025 0 repositories listed
-
Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch28 Mar 2025 0 repositories listed
-
Residual Policy Gradient: A Reward View of KL-regularized Objective14 Mar 2025 0 repositories listed
-
ROCM: RLHF on consistency models8 Mar 2025 0 repositories listed
-
SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin19 Feb 2025 0 repositories listed
-
A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals14 Feb 2025 0 repositories listed
-
Computing and Learning Stationary Mean Field Equilibria with Scalar Interactions: Algorithms and Applications2 Feb 2025 0 repositories listed
-
Metastable Dynamics of Chain-of-Thought Reasoning: Provable Benefits of Search, RL and Distillation2 Feb 2025 0 repositories listed
-
Self-Interested Agents in Collaborative Learning: An Incentivized Adaptive Data-Centric Framework9 Dec 2024 0 repositories listed
-
30 Nov 2024 0 repositories listed Syntology 3 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified (of 9 harvested samples) · 9 pointer-only (licence)
-
Solving Rubik's Cube Without Tricky Sampling29 Nov 2024 0 repositories listed
-
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning7 Nov 2024 0 repositories listed
-
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach17 Oct 2024 0 repositories listed
-
Learning in complex action spaces without policy gradients8 Oct 2024 0 repositories listed
-
Strongly-polynomial time and validation analysis of policy gradient methods28 Sep 2024 0 repositories listed
-
Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action25 Sep 2024 0 repositories listed
-
Reinforcement Learning for Causal Discovery without Acyclicity Constraints24 Aug 2024 0 repositories listed
-
Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPs19 Aug 2024 0 repositories listed
-
From Imitation to Refinement -- Residual RL for Precise Assembly23 Jul 2024 0 repositories listed
-
PG-Rainbow: Using Distributional Reinforcement Learning in Policy Gradient Methods18 Jul 2024 0 repositories listed
-
Towards Adapting Reinforcement Learning Agents to New Tasks: Insights from Q-Values14 Jul 2024 0 repositories listed
-
Augmented Bayesian Policy Search5 Jul 2024 0 repositories listed
-
Improving Reward-Conditioned Policies for Multi-Armed Bandits using Normalized Weight Functions16 Jun 2024 0 repositories listed
-
Current applications and potential future directions of reinforcement learning-based Digital Twins in agriculture13 Jun 2024 0 repositories listed
-
Optimal Rates of Convergence for Entropy Regularization in Discounted Markov Decision Processes6 Jun 2024 0 repositories listed
-
Entropy annealing for policy mirror descent in continuous time and space30 May 2024 0 repositories listed
-
Mollification Effects of Policy Gradient Methods28 May 2024 0 repositories listed
-
Linear Function Approximation as a Computationally Efficient Method to Solve Classical Reinforcement Learning Challenges27 May 2024 0 repositories listed
-
Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence23 May 2024 0 repositories listed
-
Almost sure convergence rates of stochastic gradient methods under gradient domination22 May 2024 0 repositories listed
-
An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning10 May 2024 0 repositories listed
-
Federated Reinforcement Learning with Constraint Heterogeneity6 May 2024 0 repositories listed
-
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline4 May 2024 0 repositories listed
-
Information-Theoretic Opacity-Enforcement in Markov Decision Processes30 Apr 2024 0 repositories listed
-
Control randomisation approach for policy gradient and application to reinforcement learning in optimal switching27 Apr 2024 0 repositories listed
-
Actor-Critic Reinforcement Learning with Phased Actor18 Apr 2024 0 repositories listed
-
Intervention-Assisted Policy Gradient Methods for Online Stochastic Queuing Network Optimization: Technical Report5 Apr 2024 0 repositories listed
-
Elementary Analysis of Policy Gradient Methods4 Apr 2024 0 repositories listed
-
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy21 Mar 2024 0 repositories listed
-
Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles18 Mar 2024 0 repositories listed
-
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries15 Mar 2024 0 repositories listed
-
Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis13 Mar 2024 0 repositories listed
-
Provable Policy Gradient Methods for Average-Reward Markov Potential Games9 Mar 2024 0 repositories listed
-
Fill-and-Spill: Deep Reinforcement Learning Policy Gradient Methods for Reservoir Operation Decision and Control7 Mar 2024 0 repositories listed
-
Stabilizing Policy Gradients for Stochastic Differential Equations via Consistency with Perturbation Process7 Mar 2024 0 repositories listed
-
Towards Provable Log Density Policy Gradient3 Mar 2024 0 repositories listed
-
Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate1 Mar 2024 0 repositories listed
-
When Do Off-Policy and On-Policy Policy Gradient Methods Align?19 Feb 2024 0 repositories listed
-
Identifying Policy Gradient Subspaces12 Jan 2024 0 repositories listed
-
Global Convergence of Natural Policy Gradient with Hessian-aided Momentum Variance Reduction2 Jan 2024 0 repositories listed
-
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning1 Jan 2024 0 repositories listed
-
Optimistic Policy Gradient in Multi-Player Markov Games with a Single Controller: Convergence Beyond the Minty Property19 Dec 2023 0 repositories listed
-
Privacy Preserving Multi-Agent Reinforcement Learning in Supply Chains9 Dec 2023 0 repositories listed
-
RL Dreams: Policy Gradient Optimization for Score Distillation based 3D Generation8 Dec 2023 0 repositories listed
-
Score-Aware Policy-Gradient Methods and Performance Guarantees using Local Lyapunov Conditions: Applications to Product-Form Stochastic Networks and Queueing Systems5 Dec 2023 0 repositories listed
-
A Large Deviations Perspective on Policy Gradient Algorithms13 Nov 2023 0 repositories listed
-
On the Second-Order Convergence of Biased Policy Gradient Algorithms5 Nov 2023 0 repositories listed
-
Riemannian stochastic optimization methods avoid strict saddle points4 Nov 2023 0 repositories listed
-
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning1 Nov 2023 0 repositories listed
-
Optimization Landscape of Policy Gradient Methods for Discrete-time Static Output Feedback29 Oct 2023 0 repositories listed
-
f-Policy Gradients: A General Framework for Goal Conditioned RL using f-Divergences10 Oct 2023 0 repositories listed
-
Global Convergence of Policy Gradient Methods in Reinforcement Learning, Games and Control8 Oct 2023 0 repositories listed
-
Optimizing Solution-Samplers for Combinatorial Problems: The Landscape of Policy-Gradient Methods8 Oct 2023 0 repositories listed
-
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods4 Oct 2023 0 repositories listed
-
Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds25 Sep 2023 0 repositories listed
-
Commodities Trading through Deep Policy Gradient Methods10 Aug 2023 0 repositories listed
-
Learning Decentralized Partially Observable Mean Field Control for Artificial Collective Behavior12 Jul 2023 0 repositories listed
-
Provably Convergent Policy Optimization via Metric-aware Trust Region Methods25 Jun 2023 0 repositories listed
-
Correcting discount-factor mismatch in on-policy policy gradient methods23 Jun 2023 0 repositories listed
-
Acceleration in Policy Optimization18 Jun 2023 0 repositories listed
-
Deep Policy Gradient Methods in Commodity Markets14 Jun 2023 0 repositories listed
-
Stepsize Learning for Policy Gradient Methods in Contextual Markov Decision Processes13 Jun 2023 0 repositories listed
-
Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation9 Jun 2023 0 repositories listed
-
Solving Robust MDPs through No-Regret Dynamics30 May 2023 0 repositories listed
-
Adaptive Policy Learning to Additional Tasks24 May 2023 0 repositories listed
-
Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models19 May 2023 0 repositories listed
-
Policy Gradient Methods for Discrete Time Linear Quadratic Regulator With Random Parameters29 Mar 2023 0 repositories listed
-
Policy Mirror Descent Inherently Explores Action Space8 Mar 2023 0 repositories listed
-
Policy gradient learning methods for stochastic control with exit time and applications to share repurchase pricing14 Feb 2023 0 repositories listed
-
A Policy Gradient Framework for Stochastic Optimal Control Problems with Global Convergence Guarantee11 Feb 2023 0 repositories listed
-
Stochastic Policy Gradient Methods: Improved Sample Complexity for Fisher-non-degenerate Policies3 Feb 2023 0 repositories listed
-
Accelerating Policy Gradient by Estimating Value Function from Prior Computation in Deep Reinforcement Learning2 Feb 2023 0 repositories listed
-
Policy Gradient for Rectangular Robust Markov Decision Processes31 Jan 2023 0 repositories listed
-
SoftTreeMax: Exponential Variance Reduction in Policy Gradient via Tree Search30 Jan 2023 0 repositories listed
-
Stochastic Dimension-reduced Second-order Methods for Policy Optimization28 Jan 2023 0 repositories listed
Syntology lines on 1 of the papers shown; no Syntology record for the others (a paper without an arXiv id cannot be joined to the graph, and absence from the graph layer is not a recorded non-run). “Ran” means the sample executed on a synthesized fixture, not that the paper's result was reproduced; each line links to that paper's sample list. Syntology's record for this page has not changed since , the first build that kept a record date for it; when this build read Syntology's graph is in the build record. For agents: get_harvested_code_for_paper(arxiv_id) lists each paper's samples; how to connect.