{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/policy-gradient-methods/papers/4","list_of":"/task/policy-gradient-methods","task":"Policy Gradient Methods","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":4,"rows_per_page":100,"rows":[301,382],"of":382,"counts":{"archive_papers_tagged":382,"with_a_code_link":103,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":382,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":32,"every_run_a_failure_of_syntologys_instrument":1,"listed_with_a_run_with_no_instrument_failure":32,"listed_every_run_a_failure_of_syntologys_instrument":1,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/policy-gradient-methods","prev":"/task/policy-gradient-methods/papers/3","next":null,"papers":[{"url":null,"slug":"optimal-resource-allocation-in-wireless","title":"Optimal Resource Allocation in Wireless Control Systems via Deep Policy Gradient","date":"2019-10-25","arxiv_id":"1910.11900","repositories_listed":0,"syntology":null},{"url":null,"slug":"all-action-policy-gradient-methods-a","title":"All-Action Policy Gradient Methods: A Numerical Integration Approach","date":"2019-10-21","arxiv_id":"1910.09093","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-mathcalh_2-linear","title":"Policy Optimization for $\\mathcal{H}_2$ Linear Control with $\\mathcal{H}_\\infty$ Robustness Guarantee: Implicit Regularization and Global Convergence","date":"2019-10-21","arxiv_id":"1910.09496","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-quadratic-mean-field-reinforcement","title":"Linear-Quadratic Mean-Field Reinforcement Learning: Convergence of Policy Gradient Methods","date":"2019-10-09","arxiv_id":"1910.04295","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-policy-gradient-methods-for","title":"AUGMENTED POLICY GRADIENT METHODS FOR EFFICIENT REINFORCEMENT LEARNING","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-adaptive-credit-assignment-for-sample","title":"Guided Adaptive Credit Assignment for Sample Efficient Policy Optimization","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-tree-network","title":"Policy Tree Network","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deepgait-planning-and-control-of-quadrupedal","title":"DeepGait: Planning and Control of Quadrupedal Gaits using Deep Reinforcement Learning","date":"2019-09-18","arxiv_id":"1909.08399","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-reward-learning-for-policy-gradient","title":"Transfer Reward Learning for Policy Gradient-Based Text Generation","date":"2019-09-09","arxiv_id":"1909.03622","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-pseudo-q-learning-based-deterministic","title":"Multi Pseudo Q-learning Based Deterministic Policy Gradient for Tracking Control of Autonomous Underwater Vehicles","date":"2019-09-07","arxiv_id":"1909.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-policy-gradient-methods-global","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","date":"2019-08-29","arxiv_id":"1909.01150","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-wise-control-variates-for-variance","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","date":"2019-08-08","arxiv_id":"1908.03263","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimality-and-approximation-with-policy","title":"On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift","date":"2019-08-01","arxiv_id":"1908.00261","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-in-actor-critic-methods","title":"Variance Reduction in Actor Critic Methods (ACM)","date":"2019-07-23","arxiv_id":"1907.09765","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-stochastic-mirror","title":"Policy Optimization with Stochastic Mirror Descent","date":"2019-06-25","arxiv_id":"1906.10462","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-risk-measure-in-policy-search","title":"Entropic Risk Measure in Policy Search","date":"2019-06-21","arxiv_id":"1906.09090","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-3","title":"Global Convergence of Policy Gradient Methods to (Almost) Locally Optimal Policies","date":"2019-06-19","arxiv_id":"1906.08383","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-the-policy-gradient-a-gradient","title":"Is the Policy Gradient a Gradient?","date":"2019-06-17","arxiv_id":"1906.07073","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hybrid-approach-between-adversarial","title":"A Hybrid Approach Between Adversarial Generative Networks and Actor-Critic Policy Gradient for Low Rate High-Resolution Image Compression","date":"2019-06-11","arxiv_id":"1906.04681","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-optimality-guarantees-for-policy","title":"Global Optimality Guarantees For Policy Gradient Methods","date":"2019-06-05","arxiv_id":"1906.01786","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600088","title":"Diversity-Inducing Policy Gradient: Using Maximum Mean Discrepancy to Find a Set of Diverse Policies","date":"2019-05-31","arxiv_id":"1906.00088","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-novel-policies-for-tasks","title":"Learning Novel Policies For Tasks","date":"2019-05-13","arxiv_id":"1905.05252","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-exchangeability-in-reinforcement","title":"Object Exchangeability in Reinforcement Learning: Extended Abstract","date":"2019-05-07","arxiv_id":"1905.02698","repositories_listed":0,"syntology":null},{"url":null,"slug":"similarities-between-policy-gradient-methods","title":"Similarities between policy gradient methods (PGM) in Reinforcement learning (RL) and supervised learning (SL)","date":"2019-04-12","arxiv_id":"1904.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"samples-are-not-all-useful-denoising-policy","title":"Only Relevant Information Matters: Filtering Out Noisy Samples to Boost RL","date":"2019-04-08","arxiv_id":"1904.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"startnet-online-detection-of-action-start-in","title":"StartNet: Online Detection of Action Start in Untrimmed Videos","date":"2019-03-23","arxiv_id":"1903.09868","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-exploration-via-conjugate-policies","title":"Diverse Exploration via Conjugate Policies for Policy Gradient Methods","date":"2019-02-10","arxiv_id":"1902.03633","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-distributed-4","title":"Communication-Efficient Policy Gradient Methods for Distributed Reinforcement Learning","date":"2018-12-07","arxiv_id":"1812.03239","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaframe-adaptive-frame-selection-for-fast","title":"AdaFrame: Adaptive Frame Selection for Fast Video Recognition","date":"2018-11-29","arxiv_id":"1811.12432","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-off-policy-policy-gradient-theorem-using","title":"An Off-policy Policy Gradient Theorem Using Emphatic Weightings","date":"2018-11-22","arxiv_id":"1811.09013","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-estimation-variance-elimination-in","title":"Reward-estimation variance elimination in sequential decision processes","date":"2018-11-15","arxiv_id":"1811.06225","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-a","title":"Risk-Sensitive Reinforcement Learning via Policy Gradient Search","date":"2018-10-22","arxiv_id":"1810.09126","repositories_listed":0,"syntology":null},{"url":null,"slug":"trust-region-policy-optimization-for-pomdps","title":"Policy Gradient in Partially Observable Environments: Approximation and Convergence","date":"2018-10-18","arxiv_id":"1810.07900","repositories_listed":0,"syntology":null},{"url":null,"slug":"calcs-continuously-approximating-longest","title":"CaLcs: Continuously Approximating Longest Common Subsequence for Sequence Level Optimization","date":"2018-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assumption-questioning-latent-copying-and","title":"Assumption Questioning: Latent Copying and Reward Exploitation in Question Generation","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"countering-language-drift-via-grounding","title":"Countering Language Drift via Grounding","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-wisdom-of-the-crowd-reliable-deep","title":"The wisdom of the crowd: reliable deep reinforcement learning through ensembles of Q-functions","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improvements-on-hindsight-learning","title":"Improvements on Hindsight Learning","date":"2018-09-16","arxiv_id":"1809.06719","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-captioning-based-on-deep-reinforcement","title":"Image Captioning based on Deep Reinforcement Learning","date":"2018-09-13","arxiv_id":"1809.04835","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-interrupt-a-hierarchical-deep","title":"Learning to Interrupt: A Hierarchical Deep Reinforcement Learning Framework for Efficient Exploration","date":"2018-07-30","arxiv_id":"1807.11150","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-reinforcement-learning","title":"Variance Reduction for Reinforcement Learning in Input-Driven Environments","date":"2018-07-06","arxiv_id":"1807.02264","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-demonstrations","title":"Policy Optimization with Demonstrations","date":"2018-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/focused-hierarchical-rnns-for-conditional","slug":"focused-hierarchical-rnns-for-conditional","title":"Focused Hierarchical RNNs for Conditional Sequence Processing","date":"2018-06-12","arxiv_id":"1806.04342","repositories_listed":0,"syntology":null},{"url":null,"slug":"fingerprint-policy-optimisation-for-robust","title":"Fingerprint Policy Optimisation for Robust Reinforcement Learning","date":"2018-05-27","arxiv_id":"1805.10662","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-self-imitating-diverse-policies","title":"Learning Self-Imitating Diverse Policies","date":"2018-05-25","arxiv_id":"1805.10309","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-soft-q-learning","title":"Multiagent Soft Q-Learning","date":"2018-04-25","arxiv_id":"1804.09817","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-maximizing-exploration-with-a","title":"Information Maximizing Exploration with a Latent Dynamics Model","date":"2018-04-04","arxiv_id":"1804.01238","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-policy-gradient-with","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","date":"2018-03-20","arxiv_id":"1803.07246","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-over-a-restricted-policy-class-in","title":"Optimizing over a Restricted Policy Class in Markov Decision Processes","date":"2018-02-26","arxiv_id":"1802.09646","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-stochastic-approximations-with","title":"Asynchronous stochastic approximations with asymptotically biased errors and deep multi-agent learning","date":"2018-02-22","arxiv_id":"1802.07935","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradients-for-contextual","title":"Policy Gradients for Contextual Recommendations","date":"2018-02-12","arxiv_id":"1802.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods","title":"Global Convergence of Policy Gradient Methods for the Linear Quadratic Regulator","date":"2018-01-15","arxiv_id":"1801.05039","repositories_listed":0,"syntology":null},{"url":null,"slug":"expected-policy-gradients-for-reinforcement","title":"Expected Policy Gradients for Reinforcement Learning","date":"2018-01-10","arxiv_id":"1801.03326","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-dependent-control-variates-for-policy","title":"Action-dependent Control Variates for Policy Optimization via Stein Identity","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-policy-gradient-for-alternating","title":"Adversarial Policy Gradient for Alternating Markov Games","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-1","title":"Global Convergence of Policy Gradient Methods for Linearized Control Problems","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-multiple-actions-for-stochastic","title":"Predicting Multiple Actions for Stochastic Continuous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-grounded-language-learning-1","title":"Understanding Grounded Language Learning Agents","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-batch-size-for-safe-policy-gradients","title":"Adaptive Batch Size for Safe Policy Gradients","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-grounded-language-learning","title":"Understanding Early Word Learning in Situated Artificial Agents","date":"2017-10-26","arxiv_id":"1710.09867","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning","title":"Accelerated Reinforcement Learning","date":"2017-10-23","arxiv_id":"1710.08070","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"manifold-regularization-for-kernelized-lstd","title":"Manifold Regularization for Kernelized LSTD","date":"2017-10-15","arxiv_id":"1710.05387","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-reinforcement","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines","date":"2017-06-20","arxiv_id":"1706.06643","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-view-of-entropy-regularized-markov","title":"A unified view of entropy-regularized Markov decision processes","date":"2017-05-22","arxiv_id":"1705.07798","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivalence-between-policy-gradients-and-soft","title":"Equivalence Between Policy Gradients and Soft Q-Learning","date":"2017-04-21","arxiv_id":"1704.06440","repositories_listed":0,"syntology":null},{"url":null,"slug":"stein-variational-policy-gradient","title":"Stein Variational Policy Gradient","date":"2017-04-07","arxiv_id":"1704.02399","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-policy-gradient-methods-for-improving","title":"Batch Policy Gradient Methods for Improving Neural Conversation Models","date":"2017-02-10","arxiv_id":"1702.03334","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-k-fold-method-for-baseline-estimation-in","title":"A K-fold Method for Baseline Estimation in Policy Gradient Algorithms","date":"2017-01-03","arxiv_id":"1701.00867","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning-1","title":"Sample-efficient Deep Reinforcement Learning for Dialog Control","date":"2016-12-18","arxiv_id":"1612.06000","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-off-policy","title":"Policy Gradient Methods for Off-policy Control","date":"2015-12-13","arxiv_id":"1512.04105","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-coherent-risk-measures","title":"Policy Gradient for Coherent Risk Measures","date":"2015-02-13","arxiv_id":"1502.03919","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-baseline-free-sampling-in-parameter","title":"Efficient Baseline-free Sampling in Parameter Exploring Policy Gradients: Super Symmetric PGPE","date":"2013-12-13","arxiv_id":"1312.3811","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-step-size-for-policy-gradient","title":"Adaptive Step-Size for Policy Gradient Methods","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-policy-iteration-and-natural-actor","title":"Optimistic policy iteration and natural actor-critic: A unifying view and a non-optimality result","date":"2013-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinterpretation-of-the-policy-oscillation","title":"A reinterpretation of the policy oscillation phenomenon in approximate policy iteration","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-and-improvement-of-policy-gradient","title":"Analysis and Improvement of Policy Gradient Estimation","date":"2011-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-policy-gradient-methods-with","title":"Natural Policy Gradient Methods with Parameter-based Exploration for Control Tasks","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-a-connection-between-importance-sampling","title":"On a Connection between Importance Sampling and the Likelihood Ratio Policy Gradient","date":"2010-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-for-motor-primitives-in","title":"Policy Search for Motor Primitives in Robotics","date":"2008-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"e9b9e6d50a91872ee024b44c9cdcec8a11b9071697f46d145f8054ca62865956","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}