{"url":"/method/reinforce","slug":"reinforce","name":"REINFORCE","full_name":"REINFORCE","full_name_withheld":false,"description_markdown":"**REINFORCE** is a Monte Carlo variant of a policy gradient algorithm in reinforcement learning. The agent collects samples of an episode using its current policy, and uses it to update the policy parameter $\\theta$. Since one full trajectory must be completed to construct a sample space, it is updated as an off-policy algorithm.\r\n\r\n$$ \\nabla\\_{\\theta}J\\left(\\theta\\right) = \\mathbb{E}\\_{\\pi}\\left[G\\_{t}\\nabla\\_{\\theta}\\ln\\pi\\_{\\theta}\\left(A\\_{t}\\mid{S\\_{t}}\\right)\\right]$$\r\n\r\nImage Credit: [Tingwu Wang](http://www.cs.toronto.edu/~tingwuwang/REINFORCE.pdf)","description_state":"present","introduced_year":1999,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Policy Gradient Methods","url":"/methods/category/policy-gradient-methods","pwc_aliases":[]}],"n_papers_tagged":185,"archive_num_papers":185,"papers_newest_first":[{"paper":null,"title":"Asymmetric REINFORCE for off-Policy Reinforcement Learning: Balancing positive and negative rewards","date":"2025-06-25","arxiv_id":"2506.20520","n_code_links":0,"syntology":null},{"paper":null,"title":"Quantum Fisher-Preconditioned Reinforcement Learning: From Single-Qubit Control to Rayleigh-Fading Link Adaptation","date":"2025-06-18","arxiv_id":"2506.15753","n_code_links":0,"syntology":null},{"paper":null,"title":"Zeroth-Order Optimization is Secretly Single-Step Policy Optimization","date":"2025-06-17","arxiv_id":"2506.14460","n_code_links":0,"syntology":null},{"paper":null,"title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","date":"2025-06-03","arxiv_id":"2506.02553","n_code_links":0,"syntology":null},{"paper":null,"title":"REOrdering Patches Improves Vision Models","date":"2025-05-29","arxiv_id":"2505.23751","n_code_links":0,"syntology":null},{"paper":null,"title":"Policy Gradient with Second Order Momentum","date":"2025-05-16","arxiv_id":"2505.11561","n_code_links":0,"syntology":null},{"paper":null,"title":"Measures of Variability for Risk-averse Policy Gradient","date":"2025-04-15","arxiv_id":"2504.11412","n_code_links":0,"syntology":null},{"paper":null,"title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","date":"2025-03-18","arxiv_id":"2503.14286","n_code_links":0,"syntology":null},{"paper":null,"title":"Multi-Fidelity Policy Gradient Algorithms","date":"2025-03-07","arxiv_id":"2503.05696","n_code_links":0,"syntology":null},{"paper":null,"title":"VQEL: Enabling Self-Developed Symbolic Language in Agents through Vector Quantization in Emergent Language Games","date":"2025-03-06","arxiv_id":"2503.04940","n_code_links":0,"syntology":null},{"paper":"/paper/reinforce-adversarial-attacks-on-large","title":"REINFORCE Adversarial Attacks on Large Language Models: An Adaptive, Distributional, and Semantic Objective","date":"2025-02-24","arxiv_id":"2502.17254","n_code_links":1,"syntology":null},{"paper":null,"title":"Sample Complexity of Linear Quadratic Regulator Without Initial Stability","date":"2025-02-20","arxiv_id":"2502.14210","n_code_links":0,"syntology":null},{"paper":null,"title":"REINFORCE-ING Chemical Language Models in Drug Design","date":"2025-01-27","arxiv_id":"2501.15971","n_code_links":0,"syntology":null},{"paper":"/paper/reinforce-a-simple-and-efficient-approach-for","title":"REINFORCE++: A Simple and Efficient Approach for Aligning Large Language Models","date":"2025-01-04","arxiv_id":"2501.03262","n_code_links":5,"syntology":null},{"paper":null,"title":"Graph-attention-based Casual Discovery with Trust Region-navigated Clipping Policy Optimization","date":"2024-12-27","arxiv_id":"2412.19578","n_code_links":0,"syntology":null},{"paper":null,"title":"QE-EBM: Using Quality Estimators as Energy Loss for Machine Translation","date":"2024-10-14","arxiv_id":"2410.10228","n_code_links":0,"syntology":null},{"paper":null,"title":"On Divergence Measures for Training GFlowNets","date":"2024-10-12","arxiv_id":"2410.09355","n_code_links":0,"syntology":null},{"paper":null,"title":"TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning","date":"2024-09-19","arxiv_id":"2409.13035","n_code_links":0,"syntology":null},{"paper":null,"title":"Quantum-inspired Reinforcement Learning for Synthesizable Drug Design","date":"2024-09-13","arxiv_id":"2409.09183","n_code_links":0,"syntology":null},{"paper":null,"title":"Automated Data Augmentation for Few-Shot Time Series Forecasting: A Reinforcement Learning Approach Guided by a Model Zoo","date":"2024-09-10","arxiv_id":"2409.06282","n_code_links":0,"syntology":null},{"paper":null,"title":"QuantFactor REINFORCE: Mining Steady Formulaic Alpha Factors with Variance-bounded REINFORCE","date":"2024-09-08","arxiv_id":"2409.05144","n_code_links":0,"syntology":null},{"paper":null,"title":"Reinforcement Learning: Tutorial and Survey","date":"2024-07-18","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"Model-free Distortion Canceling and Control of Quantum Devices","date":"2024-07-13","arxiv_id":"2407.09877","n_code_links":0,"syntology":null},{"paper":null,"title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","n_code_links":0,"syntology":null},{"paper":"/paper/proximal-curriculum-with-task-correlations","title":"Proximal Curriculum with Task Correlations for Deep Reinforcement Learning","date":"2024-05-03","arxiv_id":"2405.02481","n_code_links":1,"syntology":null},{"paper":"/paper/finding-visual-task-vectors","title":"Finding Visual Task Vectors","date":"2024-04-08","arxiv_id":"2404.05729","n_code_links":1,"syntology":{"ran":2,"of":11,"unverified":9,"pointer_only":11}},{"paper":null,"title":"Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis","date":"2024-03-13","arxiv_id":"2403.08955","n_code_links":0,"syntology":null},{"paper":null,"title":"Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques","date":"2024-03-09","arxiv_id":"2403.05801","n_code_links":0,"syntology":null},{"paper":"/paper/re3val-reinforced-and-reranked-generative","title":"Re3val: Reinforced and Reranked Generative Retrieval","date":"2024-01-30","arxiv_id":"2401.16979","n_code_links":0,"syntology":{"ran":8,"of":13,"unverified":5,"pointer_only":13}},{"paper":null,"title":"Quantum Architecture Search with Unsupervised Representation Learning","date":"2024-01-21","arxiv_id":"2401.11576","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":59},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":43},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":42},{"task":"/task/architecture-search","name":"Neural Architecture Search","papers":19},{"task":"/task/policy-gradient-methods","name":"Policy Gradient Methods","papers":16},{"task":"/task/deep-reinforcement-learning","name":"Deep Reinforcement Learning","papers":12},{"task":"/task/text-generation","name":"Text Generation","papers":9},{"task":"/task/diversity","name":"Diversity","papers":8},{"task":"/task/sentence","name":"Sentence","papers":8},{"task":"/task/image-classification","name":"Image Classification","papers":7},{"task":"/task/q-learning","name":"Q-Learning","papers":7},{"task":"/task/question-answering","name":"Question Answering","papers":7},{"task":"/task/decision-making","name":"Decision Making","papers":6},{"task":null,"name":"GPU","papers":6},{"task":"/task/image-captioning","name":"Image Captioning","papers":5},{"task":"/task/machine-translation","name":"Machine Translation","papers":5},{"task":"/task/recommendation-systems","name":"Recommendation Systems","papers":5},{"task":"/task/translation","name":"Translation","papers":5},{"task":"/task/image-classification","name":"image-classification","papers":5},{"task":"/task/bayesian-optimization","name":"Bayesian Optimization","papers":4}],"tasks_shown":20,"n_tasks":167,"usage_by_year":[{"year":"2011","papers":1},{"year":"2013","papers":1},{"year":"2015","papers":1},{"year":"2016","papers":6},{"year":"2017","papers":9},{"year":"2018","papers":18},{"year":"2019","papers":18},{"year":"2020","papers":31},{"year":"2021","papers":30},{"year":"2022","papers":20},{"year":"2023","papers":20},{"year":"2024","papers":16},{"year":"2025","papers":14}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/reinforce"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}