{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/ppo/papers/10","list_of":"/method/ppo","method":"PPO","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":10,"pages_in_order":10,"rows_per_page":100,"rows":[901,949],"of":949,"counts":{"archive_papers_tagged":949,"with_a_code_link":397,"where_syntology_ran_a_sample":139,"not_listed_spam_title":0,"listed":949,"listed_where_code_ran":139,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":114,"every_run_a_failure_of_syntologys_instrument":25,"listed_with_a_run_with_no_instrument_failure":114,"listed_every_run_a_failure_of_syntologys_instrument":25,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/ppo","prev":"/method/ppo/papers/9","next":null,"papers":[{"paper":null,"slug":"modified-actor-critics","title":"Modified Actor-Critics","date":"2019-07-02","arxiv_id":"1907.01298","n_code_links":0,"syntology":null},{"paper":"/paper/learning-data-augmentation-strategies-for","slug":"learning-data-augmentation-strategies-for","title":"Learning Data Augmentation Strategies for Object Detection","date":"2019-06-26","arxiv_id":"1906.11172","n_code_links":6,"syntology":{"ran":3,"of":3,"n_ran_checked":1,"n_instrument":2,"unverified":0,"pointer_only":3,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 1 violated, 0 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["tensorflow/tpu"],"state":"community repositories only","n_ran":0,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["listed"]}}},{"paper":null,"slug":"neural-proximaltrust-region-policy","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","date":"2019-06-25","arxiv_id":"1906.10306","n_code_links":0,"syntology":null},{"paper":"/paper/proximal-distilled-evolutionary-reinforcement","slug":"proximal-distilled-evolutionary-reinforcement","title":"Proximal Distilled Evolutionary Reinforcement Learning","date":"2019-06-24","arxiv_id":"1906.09807","n_code_links":1,"syntology":{"ran":6,"of":6,"n_ran_checked":6,"n_instrument":0,"unverified":0,"pointer_only":0,"phrase":"6 ran (of which 0 constructed an object rather than computing a result; 6 with no instrument failure: 0 honoured, 0 violated, 6 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["crisbodnar/pderl"],"state":"official (archive's flag): 6 ran","n_ran":6,"n_constructed":0,"n_ran_no_instrument_failure":6,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"multimodal-end-to-end-autonomous-driving","title":"Multimodal End-to-End Autonomous Driving","date":"2019-06-07","arxiv_id":"1906.03199","n_code_links":0,"syntology":null},{"paper":null,"slug":"rl-based-method-for-benchmarking-the","title":"RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01110","n_code_links":0,"syntology":null},{"paper":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","n_code_links":0,"syntology":null},{"paper":null,"slug":"combine-ppo-with-nes-to-improve-exploration","title":"Combine PPO with NES to Improve Exploration","date":"2019-05-23","arxiv_id":"1905.09492","n_code_links":0,"syntology":null},{"paper":null,"slug":"deep-q-learning-with-q-matrix-transfer","title":"Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment","date":"2019-05-23","arxiv_id":"1905.09673","n_code_links":0,"syntology":null},{"paper":"/paper/multimodal-3d-object-detection-from-simulated","slug":"multimodal-3d-object-detection-from-simulated","title":"Multimodal 3D Object Detection from Simulated Pretraining","date":"2019-05-19","arxiv_id":"1905.07754","n_code_links":2,"syntology":null},{"paper":"/paper/dimension-wise-importance-sampling-weight","slug":"dimension-wise-importance-sampling-weight","title":"Dimension-Wise Importance Sampling Weight Clipping for Sample-Efficient Reinforcement Learning","date":"2019-05-07","arxiv_id":"1905.02363","n_code_links":1,"syntology":{"ran":16,"of":19,"n_ran_checked":14,"n_instrument":2,"unverified":3,"pointer_only":18,"phrase":"16 ran (of which 0 constructed an object rather than computing a result; 14 with no instrument failure: 1 honoured, 1 violated, 12 with no contract checked; 2 where Syntology's instrument failed) · 3 unverified","official":{"repos":["seungyulhan/disc"],"state":"official (archive's flag): 16 ran","n_ran":16,"n_constructed":0,"n_ran_no_instrument_failure":14,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"autonomous-air-traffic-controller-a-deep","title":"Autonomous Air Traffic Controller: A Deep Multi-Agent Reinforcement Learning Approach","date":"2019-05-02","arxiv_id":"1905.01303","n_code_links":0,"syntology":null},{"paper":"/paper/supervised-policy-update","slug":"supervised-policy-update","title":"SUPERVISED POLICY UPDATE","date":"2019-05-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"slug":"towards-combining-on-off-policy-methods-for","title":"Towards Combining On-Off-Policy Methods for Real-World Applications","date":"2019-04-24","arxiv_id":"1904.10642","n_code_links":0,"syntology":null},{"paper":"/paper/190412622","slug":"190412622","title":"Talk Proposal: Towards the Realistic Evaluation of Evasion Attacks using CARLA","date":"2019-04-18","arxiv_id":"1904.12622","n_code_links":3,"syntology":null},{"paper":"/paper/rogue-gym-a-new-challenge-for-generalization","slug":"rogue-gym-a-new-challenge-for-generalization","title":"Rogue-Gym: A New Challenge for Generalization in Reinforcement Learning","date":"2019-04-17","arxiv_id":"1904.08129","n_code_links":2,"syntology":{"ran":1,"of":1,"n_ran_checked":0,"n_instrument":1,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","official":{"repos":["kngwyu/rogue-gym","kngwyu/rogue-gym-agents-cog19"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/shapemask-learning-to-segment-novel-objects","slug":"shapemask-learning-to-segment-novel-objects","title":"ShapeMask: Learning to Segment Novel Objects by Refining Shape Priors","date":"2019-04-05","arxiv_id":"1904.03239","n_code_links":1,"syntology":null},{"paper":"/paper/truly-proximal-policy-optimization","slug":"truly-proximal-policy-optimization","title":"Truly Proximal Policy Optimization","date":"2019-03-19","arxiv_id":"1903.07940","n_code_links":1,"syntology":null},{"paper":"/paper/sample-efficient-model-free-reinforcement","slug":"sample-efficient-model-free-reinforcement","title":"Sample-Efficient Model-Free Reinforcement Learning with Off-Policy Critics","date":"2019-03-11","arxiv_id":"1903.04193","n_code_links":1,"syntology":null},{"paper":"/paper/end-to-end-driving-deploying-through","slug":"end-to-end-driving-deploying-through","title":"Visual-based Autonomous Driving Deployment from a Stochastic and Uncertainty-aware Perspective","date":"2019-03-03","arxiv_id":"1903.00821","n_code_links":1,"syntology":null},{"paper":"/paper/trust-region-guided-proximal-policy","slug":"trust-region-guided-proximal-policy","title":"Trust Region-Guided Proximal Policy Optimization","date":"2019-01-29","arxiv_id":"1901.10314","n_code_links":2,"syntology":null},{"paper":null,"slug":"distillation-strategies-for-proximal-policy","title":"Distillation Strategies for Proximal Policy Optimization","date":"2019-01-23","arxiv_id":"1901.08128","n_code_links":0,"syntology":null},{"paper":"/paper/on-policy-trust-region-policy-optimisation","slug":"on-policy-trust-region-policy-optimisation","title":"On-Policy Trust Region Policy Optimisation with Replay Buffers","date":"2019-01-18","arxiv_id":"1901.06212","n_code_links":2,"syntology":null},{"paper":null,"slug":"exploring-applications-of-deep-reinforcement","title":"Exploring applications of deep reinforcement learning for real-world autonomous driving systems","date":"2019-01-06","arxiv_id":"1901.01536","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-logarithmic-barrier-method-for-proximal","title":"A Logarithmic Barrier Method For Proximal Policy Optimization","date":"2018-12-16","arxiv_id":"1812.06502","n_code_links":0,"syntology":null},{"paper":"/paper/sada-semantic-adversarial-diagnostic-attacks","slug":"sada-semantic-adversarial-diagnostic-attacks","title":"SADA: Semantic Adversarial Diagnostic Attacks for Autonomous Applications","date":"2018-12-05","arxiv_id":"1812.02132","n_code_links":1,"syntology":null},{"paper":null,"slug":"policy-optimization-with-model-based","title":"Policy Optimization with Model-based Explorations","date":"2018-11-18","arxiv_id":"1811.07350","n_code_links":0,"syntology":null},{"paper":null,"slug":"on-the-complexity-of-exploration-in-goal","title":"On the Complexity of Exploration in Goal-Driven Navigation","date":"2018-11-16","arxiv_id":"1811.06889","n_code_links":0,"syntology":null},{"paper":"/paper/trolleymod-v10-an-open-source-simulation-and","slug":"trolleymod-v10-an-open-source-simulation-and","title":"TrolleyMod v1.0: An Open-Source Simulation and Data-Collection Platform for Ethical Decision Making in Autonomous Vehicles","date":"2018-11-14","arxiv_id":"1811.05594","n_code_links":1,"syntology":null},{"paper":null,"slug":"equivalent-constraints-for-two-view-geometry","title":"Equivalent Constraints for Two-View Geometry: Pose Solution/Pure Rotation Identification and 3D Reconstruction","date":"2018-10-13","arxiv_id":"1810.05863","n_code_links":0,"syntology":null},{"paper":"/paper/nsga-net-a-multi-objective-genetic-algorithm","slug":"nsga-net-a-multi-objective-genetic-algorithm","title":"NSGA-Net: Neural Architecture Search using Multi-Objective Genetic Algorithm","date":"2018-10-08","arxiv_id":"1810.03522","n_code_links":2,"syntology":null},{"paper":"/paper/ppo-cma-proximal-policy-optimization-with","slug":"ppo-cma-proximal-policy-optimization-with","title":"PPO-CMA: Proximal Policy Optimization with Covariance Matrix Adaptation","date":"2018-10-05","arxiv_id":"1810.02541","n_code_links":1,"syntology":null},{"paper":"/paper/reinforcement-learning-with-perturbed-rewards","slug":"reinforcement-learning-with-perturbed-rewards","title":"Reinforcement Learning with Perturbed Rewards","date":"2018-10-02","arxiv_id":"1810.01032","n_code_links":1,"syntology":{"ran":5,"of":5,"n_ran_checked":3,"n_instrument":2,"unverified":0,"pointer_only":2,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 2 where Syntology's instrument failed) · 0 unverified","official":{"repos":["wangjksjtu/rl-perturbed-reward"],"state":"official (archive's flag): 5 ran","n_ran":5,"n_constructed":0,"n_ran_no_instrument_failure":3,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"real-time-dynamic-object-detection-for","title":"Real-time Dynamic Object Detection for Autonomous Driving using Prior 3D-Maps","date":"2018-09-28","arxiv_id":"1809.11036","n_code_links":0,"syntology":null},{"paper":"/paper/learning-end-to-end-autonomous-driving-using","slug":"learning-end-to-end-autonomous-driving-using","title":"Learning End-to-end Autonomous Driving using Guided Auxiliary Supervision","date":"2018-08-30","arxiv_id":"1808.10393","n_code_links":1,"syntology":null},{"paper":"/paper/adversarial-deep-reinforcement-learning-in","slug":"adversarial-deep-reinforcement-learning-in","title":"Adversarial Deep Reinforcement Learning in Portfolio Management","date":"2018-08-29","arxiv_id":"1808.09940","n_code_links":5,"syntology":null},{"paper":null,"slug":"proximal-policy-optimization-and-its-dynamic","title":"Proximal Policy Optimization and its Dynamic Version for Sequence Generation","date":"2018-08-24","arxiv_id":"1808.07982","n_code_links":0,"syntology":null},{"paper":"/paper/policy-optimization-with-penalized-point","slug":"policy-optimization-with-penalized-point","title":"Policy Optimization With Penalized Point Probability Distance: An Alternative To Proximal Policy Optimization","date":"2018-07-02","arxiv_id":"1807.00442","n_code_links":2,"syntology":null},{"paper":"/paper/conditional-affordance-learning-for-driving","slug":"conditional-affordance-learning-for-driving","title":"Conditional Affordance Learning for Driving in Urban Environments","date":"2018-06-18","arxiv_id":"1806.06498","n_code_links":1,"syntology":{"ran":12,"of":16,"n_ran_checked":12,"n_instrument":0,"unverified":4,"pointer_only":1,"phrase":"12 ran (of which 0 constructed an object rather than computing a result; 12 with no instrument failure: 0 honoured, 1 violated, 11 with no contract checked; 0 where Syntology's instrument failed) · 4 unverified","official":{"repos":["xl-sr/CAL"],"state":"official (archive's flag): 12 ran","n_ran":12,"n_constructed":0,"n_ran_no_instrument_failure":12,"n_unverified":4,"ran_from_kinds":["official"]}}},{"paper":"/paper/semantic-road-layout-understanding-by","slug":"semantic-road-layout-understanding-by","title":"Semantic Road Layout Understanding by Generative Adversarial Inpainting","date":"2018-05-29","arxiv_id":"1805.11746","n_code_links":0,"syntology":null},{"paper":"/paper/supervised-policy-update-for-deep","slug":"supervised-policy-update-for-deep","title":"Supervised Policy Update for Deep Reinforcement Learning","date":"2018-05-29","arxiv_id":"1805.11706","n_code_links":1,"syntology":null},{"paper":null,"slug":"an-adaptive-clipping-approach-for-proximal","title":"An Adaptive Clipping Approach for Proximal Policy Optimization","date":"2018-04-17","arxiv_id":"1804.06461","n_code_links":0,"syntology":null},{"paper":null,"slug":"variational-inference-for-policy-gradient","title":"Variational Inference for Policy Gradient","date":"2018-02-21","arxiv_id":"1802.07833","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-empirical-analysis-of-proximal-policy","title":"An Empirical Analysis of Proximal Policy Optimization with Kronecker-factored Natural Gradients","date":"2018-01-17","arxiv_id":"1801.05566","n_code_links":0,"syntology":null},{"paper":null,"slug":"exploring-deep-recurrent-models-with","title":"Exploring Deep Recurrent Models with Reinforcement Learning for Molecule Design","date":"2018-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/carla-an-open-urban-driving-simulator","slug":"carla-an-open-urban-driving-simulator","title":"CARLA: An Open Urban Driving Simulator","date":"2017-11-10","arxiv_id":"1711.03938","n_code_links":1,"syntology":null},{"paper":null,"slug":"amber-adaptive-multi-batch-experience-replay","title":"AMBER: Adaptive Multi-Batch Experience Replay for Continuous Action Control","date":"2017-10-12","arxiv_id":"1710.04423","n_code_links":0,"syntology":null},{"paper":"/paper/learning-transferable-architectures-for","slug":"learning-transferable-architectures-for","title":"Learning Transferable Architectures for Scalable Image Recognition","date":"2017-07-21","arxiv_id":"1707.07012","n_code_links":17,"syntology":{"ran":0,"of":1,"n_ran_checked":0,"n_instrument":0,"unverified":1,"pointer_only":1,"phrase":"0 ran · 1 unverified","official":null}},{"paper":"/paper/proximal-policy-optimization-algorithms","slug":"proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","arxiv_id":"1707.06347","n_code_links":188,"syntology":{"ran":99,"of":176,"n_ran_checked":71,"n_instrument":28,"unverified":77,"pointer_only":94,"phrase":"99 ran (of which 53 constructed an object rather than computing a result; 71 with no instrument failure: 7 honoured, 2 violated, 62 with no contract checked; 28 where Syntology's instrument failed) · 77 unverified","official":null}}],"record_sha256":"743c75d3e6824b291fdb10ccd60b972f166e5482f26e6dc469aa586802915816","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}