{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/policy-gradient-methods/papers/2","list_of":"/task/policy-gradient-methods","task":"Policy Gradient Methods","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":2,"pages_in_order":4,"rows_per_page":100,"rows":[101,200],"of":382,"counts":{"archive_papers_tagged":382,"with_a_code_link":103,"where_syntology_ran_a_sample":33,"not_listed_spam_title":0,"listed":382,"listed_where_code_ran":33,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":32,"every_run_a_failure_of_syntologys_instrument":1,"listed_with_a_run_with_no_instrument_failure":32,"listed_every_run_a_failure_of_syntologys_instrument":1,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/policy-gradient-methods","prev":"/task/policy-gradient-methods","next":"/task/policy-gradient-methods/papers/3","papers":[{"url":"/paper/cold-start-reinforcement-learning-with","slug":"cold-start-reinforcement-learning-with","title":"Cold-Start Reinforcement Learning with Softmax Policy Gradient","date":"2017-09-27","arxiv_id":"1709.09346","repositories_listed":1,"syntology":null},{"url":"/paper/reproducibility-of-benchmarked-deep","slug":"reproducibility-of-benchmarked-deep","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","date":"2017-08-10","arxiv_id":"1708.04133","repositories_listed":1,"syntology":null},{"url":"/paper/dual-learning-for-machine-translation","slug":"dual-learning-for-machine-translation","title":"Dual Learning for Machine Translation","date":"2016-11-01","arxiv_id":"1611.00179","repositories_listed":1,"syntology":null},{"url":null,"slug":"improving-dapo-from-a-mixed-policy","title":"Improving DAPO from a Mixed-Policy Perspective","date":"2025-07-17","arxiv_id":"2507.12931","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-pairwise-distance-matching-for","title":"Local Pairwise Distance Matching for Backpropagation-Free Reinforcement Learning","date":"2025-07-15","arxiv_id":"2507.11367","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-zero-sum-convex-markov-games","title":"Solving Zero-Sum Convex Markov Games","date":"2025-06-19","arxiv_id":"2506.16120","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-dacer-algorithm-with-high-diffusion","title":"Enhanced DACER Algorithm with High Diffusion Efficiency","date":"2025-05-29","arxiv_id":"2505.23426","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivalence-of-stochastic-and-deterministic","title":"Equivalence of stochastic and deterministic policy gradients","date":"2025-05-29","arxiv_id":"2505.23244","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-global-convergence-rates-for-federated","title":"On Global Convergence Rates for Federated Policy Gradient under Heterogeneous Environment","date":"2025-05-29","arxiv_id":"2505.23459","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-algorithm-feedback-one-shot-sat","title":"Learning from Algorithm Feedback: One-Shot SAT Solver Guidance with GNNs","date":"2025-05-21","arxiv_id":"2505.16053","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-testing-in-markov-decision-processes","title":"Policy Testing in Markov Decision Processes","date":"2025-05-21","arxiv_id":"2505.15342","repositories_listed":0,"syntology":null},{"url":null,"slug":"kippo-koopman-inspired-proximal-policy","title":"KIPPO: Koopman-Inspired Proximal Policy Optimization","date":"2025-05-20","arxiv_id":"2505.14566","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-evolving-curriculum-for-llm-reasoning","title":"Self-Evolving Curriculum for LLM Reasoning","date":"2025-05-20","arxiv_id":"2505.14970","repositories_listed":0,"syntology":null},{"url":null,"slug":"token-efficient-rl-for-llm-reasoning","title":"Token-Efficient RL for LLM Reasoning","date":"2025-04-29","arxiv_id":"2504.20834","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-policy-optimization-1","title":"Evolutionary Policy Optimization","date":"2025-04-17","arxiv_id":"2504.12568","repositories_listed":0,"syntology":null},{"url":null,"slug":"ordering-based-conditions-for-global-1","title":"Ordering-based Conditions for Global Convergence of Policy Gradient Methods","date":"2025-04-02","arxiv_id":"2504.02130","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-on-policy-policy-gradient-methods","title":"Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch","date":"2025-03-28","arxiv_id":"2503.22244","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-policy-gradient-a-reward-view-of-kl","title":"Residual Policy Gradient: A Reward View of KL-regularized Objective","date":"2025-03-14","arxiv_id":"2503.11019","repositories_listed":0,"syntology":null},{"url":null,"slug":"rocm-rlhf-on-consistency-models","title":"ROCM: RLHF on consistency models","date":"2025-03-08","arxiv_id":"2503.06171","repositories_listed":0,"syntology":null},{"url":null,"slug":"sppd-self-training-with-process-preference","title":"SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin","date":"2025-02-19","arxiv_id":"2502.13516","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-self-supervised-reinforcement-learning","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","date":"2025-02-14","arxiv_id":"2502.10482","repositories_listed":0,"syntology":null},{"url":null,"slug":"computing-and-learning-mean-field-equilibria","title":"Computing and Learning Stationary Mean Field Equilibria with Scalar Interactions: Algorithms and Applications","date":"2025-02-02","arxiv_id":"2502.12024","repositories_listed":0,"syntology":null},{"url":null,"slug":"metastable-dynamics-of-chain-of-thought","title":"Metastable Dynamics of Chain-of-Thought Reasoning: Provable Benefits of Search, RL and Distillation","date":"2025-02-02","arxiv_id":"2502.01694","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-interested-agents-in-collaborative","title":"Self-Interested Agents in Collaborative Learning: An Incentivized Adaptive Data-Centric Framework","date":"2024-12-09","arxiv_id":"2412.06597","repositories_listed":0,"syntology":null},{"url":"/paper/bots-batch-bayesian-optimization-of-extended","slug":"bots-batch-bayesian-optimization-of-extended","title":"BOTS: Batch Bayesian Optimization of Extended Thompson Sampling for Severely Episode-Limited RL Settings","date":"2024-11-30","arxiv_id":"2412.00308","repositories_listed":0,"syntology":{"n":9,"n_ran":3,"n_constructed":2,"n_ran_checked":2,"n_instrument":1,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":9,"phrase":"3 ran (of which 2 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 1 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/bots-batch-bayesian-optimization-of-extended#ran","syntology_url":"https://syntology.ai/paper/2412.00308","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2412.00308"}},"official":null}},{"url":null,"slug":"solving-rubik-s-cube-without-tricky-sampling","title":"Solving Rubik's Cube Without Tricky Sampling","date":"2024-11-29","arxiv_id":"2411.19583","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-sft-q-learning-for-language-models-via","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","date":"2024-11-07","arxiv_id":"2411.05193","repositories_listed":0,"syntology":null},{"url":null,"slug":"truncating-trajectories-in-monte-carlo-policy-1","title":"Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach","date":"2024-10-17","arxiv_id":"2410.13463","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-complex-action-spaces-without","title":"Learning in complex action spaces without policy gradients","date":"2024-10-08","arxiv_id":"2410.06317","repositories_listed":0,"syntology":null},{"url":null,"slug":"strongly-polynomial-time-and-validation","title":"Strongly-polynomial time and validation analysis of policy gradient methods","date":"2024-09-28","arxiv_id":"2409.19437","repositories_listed":0,"syntology":null},{"url":null,"slug":"landscape-of-policy-optimization-for-finite","title":"Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action","date":"2024-09-25","arxiv_id":"2409.17138","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforced-dag-learning-without","title":"Reinforcement Learning for Causal Discovery without Acyclicity Constraints","date":"2024-08-24","arxiv_id":"2408.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-policy-gradient-primal-dual","title":"Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPs","date":"2024-08-19","arxiv_id":"2408.10015","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-imitation-to-refinement-residual-rl-for","title":"From Imitation to Refinement -- Residual RL for Precise Assembly","date":"2024-07-23","arxiv_id":"2407.16677","repositories_listed":0,"syntology":null},{"url":null,"slug":"pg-rainbow-using-distributional-reinforcement","title":"PG-Rainbow: Using Distributional Reinforcement Learning in Policy Gradient Methods","date":"2024-07-18","arxiv_id":"2407.13146","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-adapting-reinforcement-learning","title":"Towards Adapting Reinforcement Learning Agents to New Tasks: Insights from Q-Values","date":"2024-07-14","arxiv_id":"2407.10335","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-bayesian-policy-search","title":"Augmented Bayesian Policy Search","date":"2024-07-05","arxiv_id":"2407.04864","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-reward-conditioned-policies-for","title":"Improving Reward-Conditioned Policies for Multi-Armed Bandits using Normalized Weight Functions","date":"2024-06-16","arxiv_id":"2406.10795","repositories_listed":0,"syntology":null},{"url":null,"slug":"current-applications-and-potential-future","title":"Current applications and potential future directions of reinforcement learning-based Digital Twins in agriculture","date":"2024-06-13","arxiv_id":"2406.08854","repositories_listed":0,"syntology":null},{"url":null,"slug":"essentially-sharp-estimates-on-the-entropy","title":"Optimal Rates of Convergence for Entropy Regularization in Discounted Markov Decision Processes","date":"2024-06-06","arxiv_id":"2406.04163","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-annealing-for-policy-mirror-descent","title":"Entropy annealing for policy mirror descent in continuous time and space","date":"2024-05-30","arxiv_id":"2405.20250","repositories_listed":0,"syntology":null},{"url":null,"slug":"mollification-effects-of-policy-gradient","title":"Mollification Effects of Policy Gradient Methods","date":"2024-05-28","arxiv_id":"2405.17832","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-function-approximation-as-a","title":"Linear Function Approximation as a Computationally Efficient Method to Solve Classical Reinforcement Learning Challenges","date":"2024-05-27","arxiv_id":"2405.20350","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-risk-sensitive","title":"Policy Gradient Methods for Risk-Sensitive Distributional Reinforcement Learning with Provable Convergence","date":"2024-05-23","arxiv_id":"2405.14749","repositories_listed":0,"syntology":null},{"url":null,"slug":"almost-sure-convergence-rates-of-stochastic-1","title":"Almost sure convergence rates of stochastic gradient methods under gradient domination","date":"2024-05-22","arxiv_id":"2405.13592","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-partial-survey-of-decentralized-cooperative","title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-with-1","title":"Federated Reinforcement Learning with Constraint Heterogeneity","date":"2024-05-06","arxiv_id":"2405.03236","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-oab-off-policy-policy-gradient-method","title":"Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline","date":"2024-05-04","arxiv_id":"2405.02572","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-opacity-enforcement-in","title":"Information-Theoretic Opacity-Enforcement in Markov Decision Processes","date":"2024-04-30","arxiv_id":"2405.00157","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-randomisation-approach-for-policy","title":"Control randomisation approach for policy gradient and application to reinforcement learning in optimal switching","date":"2024-04-27","arxiv_id":"2404.17939","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-critic-reinforcement-learning-with-1","title":"Actor-Critic Reinforcement Learning with Phased Actor","date":"2024-04-18","arxiv_id":"2404.11834","repositories_listed":0,"syntology":null},{"url":null,"slug":"intervention-assisted-policy-gradient-methods","title":"Intervention-Assisted Policy Gradient Methods for Online Stochastic Queuing Network Optimization: Technical Report","date":"2024-04-05","arxiv_id":"2404.04106","repositories_listed":0,"syntology":null},{"url":null,"slug":"elementary-analysis-of-policy-gradient","title":"Elementary Analysis of Policy Gradient Methods","date":"2024-04-04","arxiv_id":"2404.03372","repositories_listed":0,"syntology":null},{"url":null,"slug":"react-meets-actre-autonomous-annotations-of","title":"ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy","date":"2024-03-21","arxiv_id":"2403.14589","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-optimality-without-mixing-time-oracles","title":"Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles","date":"2024-03-18","arxiv_id":"2403.11925","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-guarantees-for-federated","title":"Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries","date":"2024-03-15","arxiv_id":"2403.09940","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-risk-sensitive-policy","title":"Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis","date":"2024-03-13","arxiv_id":"2403.08955","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-policy-gradient-methods-for-average","title":"Provable Policy Gradient Methods for Average-Reward Markov Potential Games","date":"2024-03-09","arxiv_id":"2403.05738","repositories_listed":0,"syntology":null},{"url":null,"slug":"fill-and-spill-deep-reinforcement-learning","title":"Fill-and-Spill: Deep Reinforcement Learning Policy Gradient Methods for Reservoir Operation Decision and Control","date":"2024-03-07","arxiv_id":"2403.04195","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-policy-gradients-for-stochastic","title":"Stabilizing Policy Gradients for Stochastic Differential Equations via Consistency with Perturbation Process","date":"2024-03-07","arxiv_id":"2403.04154","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-provable-log-density-policy-gradient","title":"Towards Provable Log Density Policy Gradient","date":"2024-03-03","arxiv_id":"2403.01605","repositories_listed":0,"syntology":null},{"url":null,"slug":"reusing-historical-trajectories-in-natural","title":"Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate","date":"2024-03-01","arxiv_id":"2403.00675","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-do-off-policy-and-on-policy-policy","title":"When Do Off-Policy and On-Policy Policy Gradient Methods Align?","date":"2024-02-19","arxiv_id":"2402.12034","repositories_listed":0,"syntology":null},{"url":null,"slug":"identifying-policy-gradient-subspaces","title":"Identifying Policy Gradient Subspaces","date":"2024-01-12","arxiv_id":"2401.06604","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-natural-policy-gradient","title":"Global Convergence of Natural Policy Gradient with Hessian-aided Momentum Variance Reduction","date":"2024-01-02","arxiv_id":"2401.01084","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-diffusion-models-towards-diverse","title":"Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-policy-gradient-in-multi-player","title":"Optimistic Policy Gradient in Multi-Player Markov Games with a Single Controller: Convergence Beyond the Minty Property","date":"2023-12-19","arxiv_id":"2312.12067","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-multi-agent-reinforcement","title":"Privacy Preserving Multi-Agent Reinforcement Learning in Supply Chains","date":"2023-12-09","arxiv_id":"2312.05686","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-dreams-policy-gradient-optimization-for","title":"RL Dreams: Policy Gradient Optimization for Score Distillation based 3D Generation","date":"2023-12-08","arxiv_id":"2312.04806","repositories_listed":0,"syntology":null},{"url":null,"slug":"score-aware-policy-gradient-methods-and","title":"Score-Aware Policy-Gradient Methods and Performance Guarantees using Local Lyapunov Conditions: Applications to Product-Form Stochastic Networks and Queueing Systems","date":"2023-12-05","arxiv_id":"2312.02804","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-deviations-perspective-on-policy","title":"A Large Deviations Perspective on Policy Gradient Algorithms","date":"2023-11-13","arxiv_id":"2311.07411","repositories_listed":0,"syntology":null},{"url":null,"slug":"preliminary-analysis-on-second-order","title":"On the Second-Order Convergence of Biased Policy Gradient Algorithms","date":"2023-11-05","arxiv_id":"2311.02546","repositories_listed":0,"syntology":null},{"url":null,"slug":"riemannian-stochastic-optimization-methods","title":"Riemannian stochastic optimization methods avoid strict saddle points","date":"2023-11-04","arxiv_id":"2311.02374","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-natural-policy-gradient-methods-for","title":"Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning","date":"2023-11-01","arxiv_id":"2311.00201","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-landscape-of-policy-gradient","title":"Optimization Landscape of Policy Gradient Methods for Discrete-time Static Output Feedback","date":"2023-10-29","arxiv_id":"2310.19022","repositories_listed":0,"syntology":null},{"url":null,"slug":"f-policy-gradients-a-general-framework-for","title":"$f$-Policy Gradients: A General Framework for Goal Conditioned RL using $f$-Divergences","date":"2023-10-10","arxiv_id":"2310.06794","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-policy-gradient-methods-4","title":"Global Convergence of Policy Gradient Methods in Reinforcement Learning, Games and Control","date":"2023-10-08","arxiv_id":"2310.05230","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-solution-samplers-for","title":"Optimizing Solution-Samplers for Combinatorial Problems: The Landscape of Policy-Gradient Methods","date":"2023-10-08","arxiv_id":"2310.05309","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-stationarity-convergence-analysis-of","title":"Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods","date":"2023-10-04","arxiv_id":"2310.02671","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-neural-policy-mirror","title":"Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds","date":"2023-09-25","arxiv_id":"2309.13915","repositories_listed":0,"syntology":null},{"url":null,"slug":"commodities-trading-through-deep-policy","title":"Commodities Trading through Deep Policy Gradient Methods","date":"2023-08-10","arxiv_id":"2309.00630","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-decentralized-partially-observable","title":"Learning Decentralized Partially Observable Mean Field Control for Artificial Collective Behavior","date":"2023-07-12","arxiv_id":"2307.06175","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-convergent-policy-optimization-via","title":"Provably Convergent Policy Optimization via Metric-aware Trust Region Methods","date":"2023-06-25","arxiv_id":"2306.14133","repositories_listed":0,"syntology":null},{"url":null,"slug":"correcting-discount-factor-mismatch-in-on","title":"Correcting discount-factor mismatch in on-policy policy gradient methods","date":"2023-06-23","arxiv_id":"2306.13284","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimism-and-adaptivity-in-policy","title":"Acceleration in Policy Optimization","date":"2023-06-18","arxiv_id":"2306.10587","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-policy-gradient-methods-in-commodity","title":"Deep Policy Gradient Methods in Commodity Markets","date":"2023-06-14","arxiv_id":"2308.01910","repositories_listed":0,"syntology":null},{"url":null,"slug":"stepsize-learning-for-policy-gradient-methods","title":"Stepsize Learning for Policy Gradient Methods in Contextual Markov Decision Processes","date":"2023-06-13","arxiv_id":"2306.07741","repositories_listed":0,"syntology":null},{"url":null,"slug":"ada-nav-adaptive-trajectory-based-sample","title":"Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation","date":"2023-06-09","arxiv_id":"2306.06192","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-robust-mdps-through-no-regret","title":"Solving Robust MDPs through No-Regret Dynamics","date":"2023-05-30","arxiv_id":"2305.19035","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-policy-learning-to-additional-tasks","title":"Adaptive Policy Learning to Additional Tasks","date":"2023-05-24","arxiv_id":"2305.15193","repositories_listed":0,"syntology":null},{"url":null,"slug":"shattering-the-agent-environment-interface","title":"Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models","date":"2023-05-19","arxiv_id":"2305.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-discrete-time","title":"Policy Gradient Methods for Discrete Time Linear Quadratic Regulator With Random Parameters","date":"2023-03-29","arxiv_id":"2303.16548","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-mirror-descent-inherently-explores","title":"Policy Mirror Descent Inherently Explores Action Space","date":"2023-03-08","arxiv_id":"2303.04386","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-learning-methods-for","title":"Policy gradient learning methods for stochastic control with exit time and applications to share repurchase pricing","date":"2023-02-14","arxiv_id":"2302.07320","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-policy-gradient-framework-for-stochastic","title":"A Policy Gradient Framework for Stochastic Optimal Control Problems with Global Convergence Guarantee","date":"2023-02-11","arxiv_id":"2302.05816","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-policy-gradient-methods-improved","title":"Stochastic Policy Gradient Methods: Improved Sample Complexity for Fisher-non-degenerate Policies","date":"2023-02-03","arxiv_id":"2302.01734","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-policy-gradient-by-estimating","title":"Accelerating Policy Gradient by Estimating Value Function from Prior Computation in Deep Reinforcement Learning","date":"2023-02-02","arxiv_id":"2302.01399","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-s-rectangular-robust","title":"Policy Gradient for Rectangular Robust Markov Decision Processes","date":"2023-01-31","arxiv_id":"2301.13589","repositories_listed":0,"syntology":null},{"url":null,"slug":"softtreemax-exponential-variance-reduction-in","title":"SoftTreeMax: Exponential Variance Reduction in Policy Gradient via Tree Search","date":"2023-01-30","arxiv_id":"2301.13236","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-dimension-reduced-second-order","title":"Stochastic Dimension-reduced Second-order Methods for Policy Optimization","date":"2023-01-28","arxiv_id":"2301.12174","repositories_listed":0,"syntology":null}],"record_sha256":"b8584ed2902e3c28ec095255dd94d2defef8a98daa2be4539e41677083247b6f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}