{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/benchmarking-deep-reinforcement-learning-for","title":"Benchmarking Deep Reinforcement Learning for Continuous Control","arxiv_id":"1604.06778","date":"2016-04-22","proceeding":null,"authors":["Yan Duan","Xi Chen","Rein Houthooft","John Schulman","Pieter Abbeel"],"abstract":"Recently, researchers have made significant progress combining the advances\nin deep learning for learning feature representations with reinforcement\nlearning. Some notable examples include training agents to play Atari games\nbased on raw pixel data and to acquire advanced manipulation skills using raw\nsensory inputs. However, it has been difficult to quantify progress in the\ndomain of continuous control due to the lack of a commonly adopted benchmark.\nIn this work, we present a benchmark suite of continuous control tasks,\nincluding classic tasks like cart-pole swing-up, tasks with very high state and\naction dimensionality such as 3D humanoid locomotion, tasks with partial\nobservations, and tasks with hierarchical structure. We report novel findings\nbased on the systematic evaluation of a range of implemented reinforcement\nlearning algorithms. Both the benchmark and reference implementations are\nreleased at https://github.com/rllab/rllab in order to facilitate experimental\nreproducibility and to encourage adoption by other researchers.","url_abs":"http://arxiv.org/abs/1604.06778v3","url_pdf":"http://arxiv.org/pdf/1604.06778v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/rllab/rllab","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/Dam930/rllab","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/bstadie/third_person_im","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/cathywu/rllab-multiagent","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/cbfinn/maml_rl","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/jachiam/cpo","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/openai/rllab","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/rejuvyesh/rllab","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/richardrl/cartpole-request-for-research","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/rll/rllab","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/rlworkgroup/garage","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/russellmendonca/maesn_suite","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/sisl/event-driven-rllab","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/sisl/gail-driver","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok","spdx":"NOASSERTION"}},{"paper_slug":"benchmarking-deep-reinforcement-learning-for","repo_url":"https://github.com/wyndwarrior/imitation_from_observation","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"unanswered"}}],"tasks":[{"task_slug":"action-triplet-recognition","task_name":"Action Triplet Recognition"},{"task_slug":"atari-games","task_name":"Atari Games"},{"task_slug":"benchmarking","task_name":"Benchmarking"},{"task_slug":"continuous-control","task_name":"Continuous Control"},{"task_slug":"deep-reinforcement-learning","task_name":"Deep Reinforcement Learning"},{"task_slug":"reinforcement-learning","task_name":"Reinforcement Learning"},{"task_slug":"reinforcement-learning-1","task_name":"Reinforcement Learning (RL)"},{"task_slug":"continuous-control","task_name":"continuous-control"},{"task_slug":"reinforcement-learning-2","task_name":"reinforcement-learning"}],"methods":[],"datasets_introduced":[{"slug":"rllab-framework","name":"RLLab Framework","full_name":""}],"methods_introduced":[],"results":[{"leaderboard":"/sota/continuous-control-on-2d-walker","task":"Continuous Control","dataset":"2D Walker","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"1353.8"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-acrobot","task":"Continuous Control","dataset":"Acrobot","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-326"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-acrobot-limited-sensors","task":"Continuous Control","dataset":"Acrobot (limited sensors)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-83.3"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-acrobot-noisy","task":"Continuous Control","dataset":"Acrobot (noisy observations)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-149.6"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-acrobot-system","task":"Continuous Control","dataset":"Acrobot (system identifications)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-170.9"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-ant","task":"Continuous Control","dataset":"Ant","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"730.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-ant-gathering","task":"Continuous Control","dataset":"Ant + Gathering","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-0.4"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-ant-maze","task":"Continuous Control","dataset":"Ant + Maze","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"0"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-cart-pole-balancing","task":"Continuous Control","dataset":"Cart-Pole Balancing","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"4869.8"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-cart-pole-balancing-1","task":"Continuous Control","dataset":"Cart-Pole Balancing (limited sensors)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"960.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-cart-pole-balancing-2","task":"Continuous Control","dataset":"Cart-Pole Balancing (noisy observations)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"606.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-cart-pole-balancing-3","task":"Continuous Control","dataset":"Cart-Pole Balancing (system identifications)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"980.3"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-double-inverted","task":"Continuous Control","dataset":"Double Inverted Pendulum","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"4412.4"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-full-humanoid","task":"Continuous Control","dataset":"Full Humanoid","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"287"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-half-cheetah","task":"Continuous Control","dataset":"Half-Cheetah","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"1914"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-hopper","task":"Continuous Control","dataset":"Hopper","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"1183.3"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-inverted-pendulum","task":"Continuous Control","dataset":"Inverted Pendulum","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"247.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-inverted-pendulum-1","task":"Continuous Control","dataset":"Inverted Pendulum (limited sensors)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"4.5"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-inverted-pendulum-noisy","task":"Continuous Control","dataset":"Inverted Pendulum (noisy observations)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"10.4"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-inverted-pendulum-2","task":"Continuous Control","dataset":"Inverted Pendulum (system identifications)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"14.1"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-mountain-car","task":"Continuous Control","dataset":"Mountain Car","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-61.7"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-mountain-car-limited","task":"Continuous Control","dataset":"Mountain Car (limited sensors)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-64.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-mountain-car-noisy","task":"Continuous Control","dataset":"Mountain Car (noisy observations)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-60.2"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-mountain-car-system","task":"Continuous Control","dataset":"Mountain Car (system identifications)","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"-61.6"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-simple-humanoid","task":"Continuous Control","dataset":"Simple Humanoid","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"269.7"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-swimmer","task":"Continuous Control","dataset":"Swimmer","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"96"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-swimmer-gathering","task":"Continuous Control","dataset":"Swimmer + Gathering","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"0"},"uses_additional_data":false},{"leaderboard":"/sota/continuous-control-on-swimmer-maze","task":"Continuous Control","dataset":"Swimmer + Maze","model":"TRPO","rank_in_archive_order":1,"of":1,"metrics":{"Score":"0"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1604.06778","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"1604.06778"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/jachiam/cpo","reach":{"status":"ok"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/rll/rllab","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/russellmendonca/maesn_suite","reach":{"status":"ok"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/rlworkgroup/garage","reach":{"status":"ok","spdx":"MIT"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/rejuvyesh/rllab","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/rllab/rllab","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/sisl/event-driven-rllab","reach":{"status":"unanswered"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/sisl/gail-driver","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/cathywu/rllab-multiagent","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/wyndwarrior/imitation_from_observation","reach":{"status":"unanswered"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/Dam930/rllab","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/richardrl/cartpole-request-for-research","reach":{"status":"ok"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/openai/rllab","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/bstadie/third_person_im","reach":{"status":"ok","spdx":"NOASSERTION"}},{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/cbfinn/maml_rl","reach":{"status":"ok","spdx":"NOASSERTION"}}],"summary":{"unverified":4},"by_repo_kind":{"listed":{"samples":4,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"286b82196c4fe36b","entry":"find_task_for_env_id_in_any_benchmark","repo":"rlworkgroup/garage","repo_kind":"listed","path":"benchmarks/src/garage_benchmarks/benchmarks.py","file_url":"https://github.com/rlworkgroup/garage/blob/HEAD/benchmarks/src/garage_benchmarks/benchmarks.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"286b82196c4fe36b"}},{"code_sha256_prefix":"4edad3b8d64c574e","entry":"get_benchmark","repo":"rlworkgroup/garage","repo_kind":"listed","path":"benchmarks/src/garage_benchmarks/benchmarks.py","file_url":"https://github.com/rlworkgroup/garage/blob/HEAD/benchmarks/src/garage_benchmarks/benchmarks.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"4edad3b8d64c574e"}},{"code_sha256_prefix":"8574703c48d0d43d","entry":"get_task","repo":"rlworkgroup/garage","repo_kind":"listed","path":"benchmarks/src/garage_benchmarks/benchmarks.py","file_url":"https://github.com/rlworkgroup/garage/blob/HEAD/benchmarks/src/garage_benchmarks/benchmarks.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"8574703c48d0d43d"}},{"code_sha256_prefix":"8a3741971be6face","entry":"make_optimizer","repo":"rlworkgroup/garage","repo_kind":"listed","path":"src/garage/_functions.py","file_url":"https://github.com/rlworkgroup/garage/blob/HEAD/src/garage/_functions.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"8a3741971be6face"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}