{"url":"/method/appo","slug":"appo","name":"APPO","full_name":"Asynchronous Proximal Policy Optimization","full_name_withheld":false,"description_markdown":null,"description_state":"absent","introduced_year":null,"introduced_by":{"title":"Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning","paper":"/paper/sample-factory-egocentric-3d-control-from","first_author":"Aleksei Petrenko","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/sample-factory-egocentric-3d-control-from"},"source":{"url":"https://arxiv.org/abs/2006.11751v2","title":"Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Distributed Reinforcement Learning","url":"/methods/category/distributed-reinforcement-learning","pwc_aliases":[]}],"n_papers_tagged":4,"archive_num_papers":4,"papers_newest_first":[{"paper":"/paper/adversarial-policy-optimization-for-offline","title":"Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning","date":"2025-03-07","arxiv_id":"2503.05306","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":2}},{"paper":"/paper/stableprompt-automatic-prompt-tuning-using","title":"StablePrompt: Automatic Prompt Tuning using Reinforcement Learning for Large Language Models","date":"2024-10-10","arxiv_id":"2410.07652","n_code_links":1,"syntology":{"ran":4,"of":9,"unverified":5,"pointer_only":9}},{"paper":"/paper/rl-based-stateful-neural-adaptive-sampling","title":"RL-based Stateful Neural Adaptive Sampling and Denoising for Real-Time Path Tracing","date":"2023-10-05","arxiv_id":"2310.03507","n_code_links":1,"syntology":null},{"paper":"/paper/sample-factory-egocentric-3d-control-from","title":"Sample Factory: Egocentric 3D Control from Pixels at 100000 FPS with Asynchronous Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11751","n_code_links":4,"syntology":{"ran":0,"of":5,"unverified":5,"pointer_only":0}}],"papers_shown":4,"tasks":[{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":2},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":2},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":2},{"task":"/task/continuous-control","name":"Continuous Control","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/fps-games","name":"FPS Games","papers":1},{"task":null,"name":"GPU","papers":1},{"task":"/task/general-reinforcement-learning","name":"General Reinforcement Learning","papers":1},{"task":"/task/image-generation","name":"Image Generation","papers":1},{"task":"/task/multi-agent-reinforcement-learning","name":"Multi-agent Reinforcement Learning","papers":1},{"task":"/task/question-answering","name":"Question Answering","papers":1},{"task":"/task/text-classification","name":"Text Classification","papers":1},{"task":"/task/text-generation","name":"Text Generation","papers":1},{"task":"/task/continuous-control","name":"continuous-control","papers":1},{"task":"/task/text-classification-1","name":"text-classification","papers":1}],"tasks_shown":15,"n_tasks":15,"usage_by_year":[{"year":"2020","papers":1},{"year":"2023","papers":1},{"year":"2024","papers":1},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/appo"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}