Browse State-of-the-Art › Policy Gradient Methods › Papers, page 3
Policy Gradient Methods
Papers archive 2025-07-28
archive papers tagged: 382 · with a code link: 103 · where Syntology ran a sample: 33 (32 with a run with no instrument failure, 1 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (33 of 382 tagged: 32 with a run with no instrument failure, 1 where every run was a failure of Syntology's instrument)
Page 3 of 4: papers 201 to 300 of 382, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
On the Global Convergence of Risk-Averse Policy Gradient Methods with Expected Conditional Risk Measures26 Jan 2023 0 repositories listed
-
Improving a sequence-to-sequence nlp model using a reinforcement learning policy algorithm28 Dec 2022 0 repositories listed
-
On the Convergence of Discounted Policy Gradient Methods28 Dec 2022 0 repositories listed
-
An Improved Analysis of (Variance-Reduced) Policy Gradient and Natural Policy Gradient Methods15 Nov 2022 0 repositories listed
-
Geometry and convergence of natural policy gradient methods3 Nov 2022 0 repositories listed
-
Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems1 Nov 2022 0 repositories listed
-
Symmetric (Optimistic) Natural Policy Gradient for Multi-agent Learning with Parameter Convergence23 Oct 2022 0 repositories listed
-
Policy Gradient Methods for Designing Dynamic Output Feedback Controllers18 Oct 2022 0 repositories listed
-
On the convergence of policy gradient methods to Nash equilibria in general stochastic games17 Oct 2022 0 repositories listed
-
Linear Convergence of Natural Policy Gradient Methods with Log-Linear Policies4 Oct 2022 0 repositories listed
-
SoftTreeMax: Policy Gradient with Tree Search28 Sep 2022 0 repositories listed
-
Asynchronous Actor-Critic for Multi-Agent Reinforcement Learning20 Sep 2022 0 repositories listed
-
On the Optimization Landscape of Dynamic Output Feedback: A Case Study for Linear Quadratic Regulator12 Sep 2022 0 repositories listed
-
Natural Policy Gradients In Reinforcement Learning Explained5 Sep 2022 0 repositories listed
-
Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework12 Jul 2022 0 repositories listed
-
Convergence and Price of Anarchy Guarantees of the Softmax Policy Gradient in Markov Potential Games15 Jun 2022 0 repositories listed
-
How are policy gradient methods affected by the limits of control?14 Jun 2022 0 repositories listed
-
Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization14 Jun 2022 0 repositories listed
-
Learning Dynamics and Generalization in Reinforcement Learning5 Jun 2022 0 repositories listed
-
Stochastic Second-Order Methods Improve Best-Known Sample Complexity of SGD for Gradient-Dominated Function25 May 2022 0 repositories listed
-
Momentum-Based Policy Gradient with Second-Order Information17 May 2022 0 repositories listed
-
Stochastic first-order methods for average-reward Markov decision processes11 May 2022 0 repositories listed
-
Learning to Constrain Policy Optimization with Virtual Trust Region20 Apr 2022 0 repositories listed
-
Independent Natural Policy Gradient Methods for Potential Games: Finite-time Global Convergence with Entropy Regularization12 Apr 2022 0 repositories listed
-
Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach29 Mar 2022 0 repositories listed
-
Non-Parametric Stochastic Policy Gradient with Strategic Retreat for Non-Stationary Environment24 Mar 2022 0 repositories listed
-
Linear convergence of a policy gradient method for some finite horizon continuous time control problems22 Mar 2022 0 repositories listed
-
Policy Learning and Evaluation with Randomized Quasi-Monte Carlo16 Feb 2022 0 repositories listed
-
Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence8 Feb 2022 0 repositories listed
-
PAGE-PG: A Simple and Loopless Variance-Reduced Policy Gradient Method with Probabilistic Gradient Estimation1 Feb 2022 0 repositories listed
-
Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity24 Jan 2022 0 repositories listed
-
On the Convergence Rates of Policy Gradient Methods19 Jan 2022 0 repositories listed
-
Reinforcement Learning based Sequential Batch-sampling for Bayesian Optimal Experimental Design21 Dec 2021 0 repositories listed
-
Global Convergence Using Policy Gradient Methods for Model-free Markovian Jump Linear Quadratic Control30 Nov 2021 0 repositories listed
-
Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution3 Nov 2021 0 repositories listed
-
Convergence and Optimality of Policy Gradient Methods in Weakly Smooth Settings30 Oct 2021 0 repositories listed
-
Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization19 Oct 2021 0 repositories listed
-
Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning16 Oct 2021 0 repositories listed
-
Stabilizing Dynamical Systems via Policy Gradient Methods13 Oct 2021 0 repositories listed
-
Actor-Critic Policy Optimization in a Large-Scale Imperfect-Information Game29 Sep 2021 0 repositories listed
-
Asynchronous Multi-Agent Actor-Critic with Macro-Actions29 Sep 2021 0 repositories listed
-
Efficient Wasserstein and Sinkhorn Policy Optimization29 Sep 2021 0 repositories listed
-
Evolution Strategies as an Alternate Learning method for Hierarchical Reinforcement Learning29 Sep 2021 0 repositories listed
-
Programmatic Reinforcement Learning without Oracles29 Sep 2021 0 repositories listed
-
Sample-efficient actor-critic algorithms with an etiquette for zero-sum Markov games29 Sep 2021 0 repositories listed
-
Variance Reduced Domain Randomization for Policy Gradient29 Sep 2021 0 repositories listed
-
Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods13 Sep 2021 0 repositories listed
-
Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings28 Jul 2021 0 repositories listed
-
Policy Gradient Methods Find the Nash Equilibrium in N-player General-sum Linear-quadratic Games27 Jul 2021 0 repositories listed
-
Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information20 Jul 2021 0 repositories listed
-
Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences17 Jul 2021 0 repositories listed
-
Fine-Grained AutoAugmentation for Multi-Label Classification12 Jul 2021 0 repositories listed
-
Policy Gradient Methods for Distortion Risk Measures9 Jul 2021 0 repositories listed
-
Curious Explorer: a provable exploration strategy in Policy Learning29 Jun 2021 0 repositories listed
-
Modularity in Reinforcement Learning via Algorithmic Independence in Credit Assignment28 Jun 2021 0 repositories listed
-
End-to-End Neuro-Symbolic Architecture for Image-to-Image Reasoning Tasks6 Jun 2021 0 repositories listed
-
Ad Headline Generation using Self-Critical Masked Language Model1 Jun 2021 0 repositories listed
-
Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning31 May 2021 0 repositories listed
-
Meta Learning the Step Size in Policy Gradient Methods20 May 2021 0 repositories listed
-
Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial17 May 2021 0 repositories listed
-
On the Linear convergence of Natural Policy Gradient Algorithm4 May 2021 0 repositories listed
-
Semi-On-Policy Training for Sample Efficient Multi-Agent Policy Gradients27 Apr 2021 0 repositories listed
-
Softmax Policy Gradient Methods Can Take Exponential Time to Converge22 Feb 2021 0 repositories listed
-
Factored Policy Gradients: Leveraging Structure for Efficient Learning in MOMDPs20 Feb 2021 0 repositories listed
-
Strategic bidding in freight transport using deep reinforcement learning18 Feb 2021 0 repositories listed
-
Provably Efficient Policy Optimization for Two-Player Zero-Sum Markov Games17 Feb 2021 0 repositories listed
-
Independent Policy Gradient Methods for Competitive Reinforcement Learning11 Jan 2021 0 repositories listed
-
Incremental Policy Gradients for Online Reinforcement Learning Control1 Jan 2021 0 repositories listed
-
PGPS : Coupling Policy Gradient with Population-based Search1 Jan 2021 0 repositories listed
-
Self-Supervised Continuous Control without Policy Gradient1 Jan 2021 0 repositories listed
-
29 Dec 2020 0 repositories listed
-
Difference Rewards Policy Gradients21 Dec 2020 0 repositories listed
-
Sample Complexity of Policy Gradient Finding Second-Order Stationary Points2 Dec 2020 0 repositories listed
-
Reinforcement Learning in Linear Quadratic Deep Structured Teams: Global Convergence of Policy Gradient Methods29 Nov 2020 0 repositories listed
-
Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence24 Nov 2020 0 repositories listed
-
Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon20 Nov 2020 0 repositories listed
-
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods4 Nov 2020 0 repositories listed
-
A Study of Policy Gradient on a Class of Exactly Solvable Models3 Nov 2020 0 repositories listed
-
Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient27 Oct 2020 0 repositories listed
-
Sample Efficient Reinforcement Learning with REINFORCE22 Oct 2020 0 repositories listed
-
Rethinking Deep Policy Gradients via State-Wise Policy Improvement19 Oct 2020 0 repositories listed
-
Evolutionary Selective Imitation: Interpretable Agents by Imitation Learning Without a Demonstrator17 Sep 2020 0 repositories listed
-
Approximation Benefits of Policy Gradient Methods with Aggregated States22 Jul 2020 0 repositories listed
-
On Linear Convergence of Policy Gradient Methods for Finite MDPs21 Jul 2020 0 repositories listed
-
Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization13 Jul 2020 0 repositories listed
-
Policy Gradient Optimization of Thompson Sampling Policies30 Jun 2020 0 repositories listed
-
An operator view of policy gradient methods19 Jun 2020 0 repositories listed
-
Lifelong Learning of Factored Policies via Policy Gradients12 Jun 2020 0 repositories listed
-
Zeroth-Order Supervised Policy Improvement11 Jun 2020 0 repositories listed
-
On the Global Convergence Rates of Softmax Policy Gradient Methods13 May 2020 0 repositories listed
-
Improving Sample Efficiency and Multi-Agent Communication in RL-based Train Rescheduling28 Apr 2020 0 repositories listed
-
Safe Reinforcement Learning via Projection on a Safe Set: How to Achieve Optimality?2 Apr 2020 0 repositories listed
-
Exchangeable Input Representations for Reinforcement Learning19 Mar 2020 0 repositories listed
-
Stochastic Recursive Momentum for Policy Gradient Methods9 Mar 2020 0 repositories listed
-
GACEM: Generalized Autoregressive Cross Entropy Method for Multi-Modal Black Box Constraint Satisfaction17 Feb 2020 0 repositories listed
-
Statistically Efficient Off-Policy Policy Gradients10 Feb 2020 0 repositories listed
-
Bayesian Residual Policy Optimization: Scalable Bayesian Reinforcement Learning with Clairvoyant Experts7 Feb 2020 0 repositories listed
-
Neural MMO v1.3: A Massively Multiagent Game Environment for Training and Evaluating Neural Networks31 Jan 2020 0 repositories listed
-
Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment25 Jan 2020 0 repositories listed
-
Entropy Regularization with Discounted Future State Distribution in Policy Gradient Methods11 Dec 2019 0 repositories listed