{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/policy-gradient-methods/papers/3","list_of":"/task/policy-gradient-methods","task":"Policy Gradient Methods","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":382,"counts":{"archive_papers_tagged":382,"with_a_code_link":103,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":382,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":32,"every_run_a_failure_of_syntologys_instrument":1,"listed_with_a_run_with_no_instrument_failure":32,"listed_every_run_a_failure_of_syntologys_instrument":1,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/policy-gradient-methods","prev":"/task/policy-gradient-methods/papers/2","next":"/task/policy-gradient-methods/papers/4","papers":[{"url":null,"slug":"on-the-global-convergence-of-risk-averse","title":"On the Global Convergence of Risk-Averse Policy Gradient Methods with Expected Conditional Risk Measures","date":"2023-01-26","arxiv_id":"2301.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-a-sequence-to-sequence-nlp-model","title":"Improving a sequence-to-sequence nlp model using a reinforcement learning policy algorithm","date":"2022-12-28","arxiv_id":"2212.14117","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-discounted-policy","title":"On the Convergence of Discounted Policy Gradient Methods","date":"2022-12-28","arxiv_id":"2212.14066","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-analysis-of-variance-reduced-1","title":"An Improved Analysis of (Variance-Reduced) Policy Gradient and Natural Policy Gradient Methods","date":"2022-11-15","arxiv_id":"2211.07937","repositories_listed":0,"syntology":null},{"url":null,"slug":"geometry-and-convergence-of-natural-policy","title":"Geometry and convergence of natural policy gradient methods","date":"2022-11-03","arxiv_id":"2211.02105","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-of-policy-gradient-methods-for","title":"Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems","date":"2022-11-01","arxiv_id":"2211.00617","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetric-optimistic-natural-policy-gradient","title":"Symmetric (Optimistic) Natural Policy Gradient for Multi-agent Learning with Parameter Convergence","date":"2022-10-23","arxiv_id":"2210.12812","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-designing-dynamic","title":"Policy Gradient Methods for Designing Dynamic Output Feedback Controllers","date":"2022-10-18","arxiv_id":"2210.09735","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-policy-gradient-methods","title":"On the convergence of policy gradient methods to Nash equilibria in general stochastic games","date":"2022-10-17","arxiv_id":"2210.08857","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-convergence-of-natural-policy-gradient","title":"Linear Convergence of Natural Policy Gradient Methods with Log-Linear Policies","date":"2022-10-04","arxiv_id":"2210.01400","repositories_listed":0,"syntology":null},{"url":null,"slug":"softtreemax-policy-gradient-with-tree-search","title":"SoftTreeMax: Policy Gradient with Tree Search","date":"2022-09-28","arxiv_id":"2209.13966","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-actor-critic-for-multi-agent","title":"Asynchronous Actor-Critic for Multi-Agent Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.10113","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-optimization-landscape-of-dynamic","title":"On the Optimization Landscape of Dynamic Output Feedback: A Case Study for Linear Quadratic Regulator","date":"2022-09-12","arxiv_id":"2209.05042","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-policy-gradients-in-reinforcement","title":"Natural Policy Gradients In Reinforcement Learning Explained","date":"2022-09-05","arxiv_id":"2209.01820","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-global-optimality-in-cooperative-marl","title":"Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework","date":"2022-07-12","arxiv_id":"2207.11143","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-and-price-of-anarchy-guarantees","title":"Convergence and Price of Anarchy Guarantees of the Softmax Policy Gradient in Markov Potential Games","date":"2022-06-15","arxiv_id":"2206.07642","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-are-policy-gradient-methods-affected-by","title":"How are policy gradient methods affected by the limits of control?","date":"2022-06-14","arxiv_id":"2206.06863","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-policy-gradient","title":"Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization","date":"2022-06-14","arxiv_id":"2206.06827","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamics-and-generalization-in","title":"Learning Dynamics and Generalization in Reinforcement Learning","date":"2022-06-05","arxiv_id":"2206.02126","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-second-order-methods-provably-beat","title":"Stochastic Second-Order Methods Improve Best-Known Sample Complexity of SGD for Gradient-Dominated Function","date":"2022-05-25","arxiv_id":"2205.12856","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-momentum-based-policy-gradient-with","title":"Momentum-Based Policy Gradient with Second-Order Information","date":"2022-05-17","arxiv_id":"2205.08253","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-first-order-methods-for-average","title":"Stochastic first-order methods for average-reward Markov decision processes","date":"2022-05-11","arxiv_id":"2205.05800","repositories_listed":0,"syntology":null},{"url":null,"slug":"memory-constrained-policy-optimization-1","title":"Learning to Constrain Policy Optimization with Virtual Trust Region","date":"2022-04-20","arxiv_id":"2204.09315","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-natural-policy-gradient-methods","title":"Independent Natural Policy Gradient Methods for Potential Games: Finite-time Global Convergence with Entropy Regularization","date":"2022-04-12","arxiv_id":"2204.05466","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-asynchronous-cooperation-with","title":"Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach","date":"2022-03-29","arxiv_id":"2203.15925","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-parametric-stochastic-policy-gradient","title":"Non-Parametric Stochastic Policy Gradient with Strategic Retreat for Non-Stationary Environment","date":"2022-03-24","arxiv_id":"2203.14905","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-convergence-of-a-policy-gradient","title":"Linear convergence of a policy gradient method for some finite horizon continuous time control problems","date":"2022-03-22","arxiv_id":"2203.11758","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-learning-and-evaluation-with","title":"Policy Learning and Evaluation with Randomized Quasi-Monte Carlo","date":"2022-02-16","arxiv_id":"2202.07808","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-policy-gradient-for-large-scale","title":"Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence","date":"2022-02-08","arxiv_id":"2202.04129","repositories_listed":0,"syntology":null},{"url":null,"slug":"page-pg-a-simple-and-loopless-variance","title":"PAGE-PG: A Simple and Loopless Variance-Reduced Policy Gradient Method with Probabilistic Gradient Estimation","date":"2022-02-01","arxiv_id":"2202.00308","repositories_listed":0,"syntology":null},{"url":null,"slug":"homotopic-policy-mirror-descent-policy","title":"Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity","date":"2022-01-24","arxiv_id":"2201.09457","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-rates-of-policy-gradient","title":"On the Convergence Rates of Policy Gradient Methods","date":"2022-01-19","arxiv_id":"2201.07443","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-sequential-batch","title":"Reinforcement Learning based Sequential Batch-sampling for Bayesian Optimal Experimental Design","date":"2021-12-21","arxiv_id":"2112.10944","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-using-policy-gradient","title":"Global Convergence Using Policy Gradient Methods for Model-free Markovian Jump Linear Quadratic Control","date":"2021-11-30","arxiv_id":"2111.15228","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-with-continuous","title":"Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution","date":"2021-11-03","arxiv_id":"2111.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-and-optimality-of-policy-gradient","title":"Convergence and Optimality of Policy Gradient Methods in Weakly Smooth Settings","date":"2021-10-30","arxiv_id":"2111.00185","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-exact-gradients-convergence-of","title":"Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization","date":"2021-10-19","arxiv_id":"2110.10117","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-advantage-actor-critic-for-robust-multi","title":"Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning","date":"2021-10-16","arxiv_id":"2110.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-dynamical-systems-via-policy","title":"Stabilizing Dynamical Systems via Policy Gradient Methods","date":"2021-10-13","arxiv_id":"2110.06418","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-policy-optimization-in-a-large","title":"Actor-Critic Policy Optimization in a Large-Scale Imperfect-Information Game","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-multi-agent-actor-critic-with","title":"Asynchronous Multi-Agent Actor-Critic with Macro-Actions","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-wasserstein-and-sinkhorn-policy","title":"Efficient Wasserstein and Sinkhorn Policy Optimization","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-strategies-as-an-alternate-learning","title":"Evolution Strategies as an Alternate Learning method for Hierarchical Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"programmatic-reinforcement-learning-without","title":"Programmatic Reinforcement Learning without Oracles","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-actor-critic-algorithms-with","title":"Sample-efficient actor-critic algorithms with an etiquette for zero-sum Markov games","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-domain-randomization-for","title":"Variance Reduced Domain Randomization for Policy Gradient","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretical-guarantees-of-fictitious-discount","title":"Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods","date":"2021-09-13","arxiv_id":"2109.06362","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-reinforcement-learning-for","title":"Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings","date":"2021-07-28","arxiv_id":"2107.13356","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-find-the-nash","title":"Policy Gradient Methods Find the Nash Equilibrium in N-player General-sum Linear-quadratic Games","date":"2021-07-27","arxiv_id":"2107.13090","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-for-tracking","title":"Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information","date":"2021-07-20","arxiv_id":"2107.09647","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedification-operators-for-policy","title":"Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences","date":"2021-07-17","arxiv_id":"2107.08285","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-autoaugmentation-for-multi-label","title":"Fine-Grained AutoAugmentation for Multi-Label Classification","date":"2021-07-12","arxiv_id":"2107.05384","repositories_listed":0,"syntology":null},{"url":null,"slug":"likelihood-ratio-based-policy-gradient","title":"Policy Gradient Methods for Distortion Risk Measures","date":"2021-07-09","arxiv_id":"2107.04422","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-explorer-a-provable-exploration","title":"Curious Explorer: a provable exploration strategy in Policy Learning","date":"2021-06-29","arxiv_id":"2106.15503","repositories_listed":0,"syntology":null},{"url":null,"slug":"modularity-in-reinforcement-learning-via","title":"Modularity in Reinforcement Learning via Algorithmic Independence in Credit Assignment","date":"2021-06-28","arxiv_id":"2106.14993","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-neuro-symbolic-architecture-for","title":"End-to-End Neuro-Symbolic Architecture for Image-to-Image Reasoning Tasks","date":"2021-06-06","arxiv_id":"2106.03121","repositories_listed":0,"syntology":null},{"url":null,"slug":"ad-headline-generation-using-self-critical","title":"Ad Headline Generation using Self-Critical Masked Language Model","date":"2021-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tesseract-tensorised-actors-for-multi-agent","title":"Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning","date":"2021-05-31","arxiv_id":"2106.00136","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learning-the-step-size-in-policy","title":"Meta Learning the Step Size in Policy Gradient Methods","date":"2021-05-20","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-an-inverted-pendulum-with-policy","title":"Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial","date":"2021-05-17","arxiv_id":"2105.07998","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-linear-convergence-of-natural-policy","title":"On the Linear convergence of Natural Policy Gradient Algorithm","date":"2021-05-04","arxiv_id":"2105.01424","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-on-policy-training-for-sample-efficient","title":"Semi-On-Policy Training for Sample Efficient Multi-Agent Policy Gradients","date":"2021-04-27","arxiv_id":"2104.13446","repositories_listed":0,"syntology":null},{"url":null,"slug":"softmax-policy-gradient-methods-can-take","title":"Softmax Policy Gradient Methods Can Take Exponential Time to Converge","date":"2021-02-22","arxiv_id":"2102.11270","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-policy-gradients","title":"Factored Policy Gradients: Leveraging Structure for Efficient Learning in MOMDPs","date":"2021-02-20","arxiv_id":"2102.10362","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-bidding-in-freight-transport-using","title":"Strategic bidding in freight transport using deep reinforcement learning","date":"2021-02-18","arxiv_id":"2102.09253","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-policy-gradient-methods","title":"Provably Efficient Policy Optimization for Two-Player Zero-Sum Markov Games","date":"2021-02-17","arxiv_id":"2102.08903","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-policy-gradient-methods-for-1","title":"Independent Policy Gradient Methods for Competitive Reinforcement Learning","date":"2021-01-11","arxiv_id":"2101.04233","repositories_listed":0,"syntology":null},{"url":null,"slug":"incremental-policy-gradients-for-online","title":"Incremental Policy Gradients for Online Reinforcement Learning Control","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pgps-coupling-policy-gradient-with-population","title":"PGPS : Coupling Policy Gradient with Population-based Search","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-continuous-control-without","title":"Self-Supervised Continuous Control without Policy Gradient","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/2d-or-not-2d-adaptive-3d-convolution","slug":"2d-or-not-2d-adaptive-3d-convolution","title":"2D or not 2D? Adaptive 3D Convolution Selection for Efficient Video Recognition","date":"2020-12-29","arxiv_id":"2012.14950","repositories_listed":0,"syntology":null},{"url":null,"slug":"difference-rewards-policy-gradients","title":"Difference Rewards Policy Gradients","date":"2020-12-21","arxiv_id":"2012.11258","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-policy-gradient-finding","title":"Sample Complexity of Policy Gradient Finding Second-Order Stationary Points","date":"2020-12-02","arxiv_id":"2012.01491","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-linear-quadratic","title":"Reinforcement Learning in Linear Quadratic Deep Structured Teams: Global Convergence of Policy Gradient Methods","date":"2020-11-29","arxiv_id":"2011.14393","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-markovian-jump-linear","title":"Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence","date":"2020-11-24","arxiv_id":"2011.11852","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-the-noisy-linear","title":"Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon","date":"2020-11-20","arxiv_id":"2011.10300","repositories_listed":0,"syntology":null},{"url":null,"slug":"mbvi-model-based-value-initialization-for","title":"Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods","date":"2020-11-04","arxiv_id":"2011.02073","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-policy-gradient-on-a-class-of","title":"A Study of Policy Gradient on a Class of Exactly Solvable Models","date":"2020-11-03","arxiv_id":"2011.01859","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-reinforcement-learning-with-a","title":"Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient","date":"2020-10-27","arxiv_id":"2010.14771","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-with-1","title":"Sample Efficient Reinforcement Learning with REINFORCE","date":"2020-10-22","arxiv_id":"2010.11364","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-deep-policy-gradients-via-state","title":"Rethinking Deep Policy Gradients via State-Wise Policy Improvement","date":"2020-10-19","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-selective-imitation","title":"Evolutionary Selective Imitation: Interpretable Agents by Imitation Learning Without a Demonstrator","date":"2020-09-17","arxiv_id":"2009.08403","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximation-benefits-of-policy-gradient","title":"Approximation Benefits of Policy Gradient Methods with Aggregated States","date":"2020-07-22","arxiv_id":"2007.11684","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-note-on-the-linear-convergence-of-policy","title":"On Linear Convergence of Policy Gradient Methods for Finite MDPs","date":"2020-07-21","arxiv_id":"2007.11120","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-global-convergence-of-natural-policy","title":"Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization","date":"2020-07-13","arxiv_id":"2007.06558","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-optimization-of-thompson","title":"Policy Gradient Optimization of Thompson Sampling Policies","date":"2020-06-30","arxiv_id":"2006.16507","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-operator-view-of-policy-gradient-methods","title":"An operator view of policy gradient methods","date":"2020-06-19","arxiv_id":"2006.11266","repositories_listed":0,"syntology":null},{"url":null,"slug":"lifelong-learning-of-factored-policies-via","title":"Lifelong Learning of Factored Policies via Policy Gradients","date":"2020-06-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zeroth-order-supervised-policy-improvement","title":"Zeroth-Order Supervised Policy Improvement","date":"2020-06-11","arxiv_id":"2006.06600","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-global-convergence-rates-of-softmax","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","date":"2020-05-13","arxiv_id":"2005.06392","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-sample-efficiency-and-multi-agent","title":"Improving Sample Efficiency and Multi-Agent Communication in RL-based Train Rescheduling","date":"2020-04-28","arxiv_id":"2004.13439","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-via-projection-on","title":"Safe Reinforcement Learning via Projection on a Safe Set: How to Achieve Optimality?","date":"2020-04-02","arxiv_id":"2004.00915","repositories_listed":0,"syntology":null},{"url":null,"slug":"exchangeable-input-representations-for","title":"Exchangeable Input Representations for Reinforcement Learning","date":"2020-03-19","arxiv_id":"2003.09022","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-recursive-momentum-for-policy","title":"Stochastic Recursive Momentum for Policy Gradient Methods","date":"2020-03-09","arxiv_id":"2003.04302","repositories_listed":0,"syntology":null},{"url":null,"slug":"gacem-generalized-autoregressive-cross","title":"GACEM: Generalized Autoregressive Cross Entropy Method for Multi-Modal Black Box Constraint Satisfaction","date":"2020-02-17","arxiv_id":"2002.07236","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistically-efficient-off-policy-policy","title":"Statistically Efficient Off-Policy Policy Gradients","date":"2020-02-10","arxiv_id":"2002.04014","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-residual-policy-optimization-1","title":"Bayesian Residual Policy Optimization: Scalable Bayesian Reinforcement Learning with Clairvoyant Experts","date":"2020-02-07","arxiv_id":"2002.03042","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-mmo-v13-a-massively-multiagent-game","title":"Neural MMO v1.3: A Massively Multiagent Game Environment for Training and Evaluating Neural Networks","date":"2020-01-31","arxiv_id":"2001.12004","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-blind","title":"Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment","date":"2020-01-25","arxiv_id":"2001.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-regularization-with-discounted-future","title":"Entropy Regularization with Discounted Future State Distribution in Policy Gradient Methods","date":"2019-12-11","arxiv_id":"1912.05104","repositories_listed":0,"syntology":null}],"record_sha256":"3567ba315ba7363be973a6c1001a9e4d372e11da71f9ba1093e2429c0f4f5455","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}