{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/openai-gym/papers/4","list_of":"/task/openai-gym","task":"OpenAI Gym","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":4,"rows_per_page":100,"rows":[301,382],"of":382,"counts":{"archive_papers_tagged":382,"with_a_code_link":179,"where_syntology_ran_a_sample":43,"not_listed_spam_title":0,"listed":382,"listed_where_code_ran":43,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":37,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":37,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/openai-gym","prev":"/task/openai-gym/papers/3","next":null,"papers":[{"url":null,"slug":"improving-reinforcement-learning-with-human","title":"Improving Reinforcement Learning with Human Assistance: An Argument for Human Subject Studies with HIPPO Gym","date":"2021-02-02","arxiv_id":"2102.02639","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-from-dynamic-demonstration","title":"Deep Q Learning from Dynamic Demonstration with Behavioral Cloning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"error-controlled-actor-critic-method-to","title":"Error Controlled Actor-Critic Method to Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-advantage-actor-critic-non-1","title":"Towards Understanding Asynchronous Advantage Actor-critic: Convergence and Linear Speedup","date":"2020-12-31","arxiv_id":"2012.15511","repositories_listed":0,"syntology":null},{"url":null,"slug":"2012-11643","title":"myGym: Modular Toolkit for Visuomotor Robotic Tasks","date":"2020-12-21","arxiv_id":"2012.11643","repositories_listed":0,"syntology":null},{"url":null,"slug":"evading-web-application-firewalls-with","title":"Evading Web Application Firewalls with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lagnetvip-a-lagrangian-neural-network-for","title":"LagNetViP: A Lagrangian Neural Network for Video Prediction","date":"2020-10-24","arxiv_id":"2010.12932","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-gradient-ppo-with-policy","title":"Proximal Policy Gradient: PPO with Policy Gradient","date":"2020-10-20","arxiv_id":"2010.09933","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-of-koopman-representation-for","title":"Deep Learning of Koopman Representation for Control","date":"2020-10-15","arxiv_id":"2010.07546","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-distributed-reinforcement-learning","title":"A Learning Approach to Robot-Agnostic Force-Guided High Precision Assembly","date":"2020-10-15","arxiv_id":"2010.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"madras-multi-agent-driving-simulator","title":"MADRaS : Multi Agent Driving Simulator","date":"2020-10-02","arxiv_id":"2010.00993","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-mixed","title":"Deep Reinforcement Learning with Mixed Convolutional Network","date":"2020-10-01","arxiv_id":"2010.00717","repositories_listed":0,"syntology":null},{"url":null,"slug":"mdp-playground-controlling-orthogonal","title":"MDP Playground: Controlling Orthogonal Dimensions of Hardness in Toy Environments","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-selective-imitation","title":"Evolutionary Selective Imitation: Interpretable Agents by Imitation Learning Without a Demonstrator","date":"2020-09-17","arxiv_id":"2009.08403","repositories_listed":0,"syntology":null},{"url":null,"slug":"extended-radial-basis-function-controller-for","title":"Extended Radial Basis Function Controller for Reinforcement Learning","date":"2020-09-12","arxiv_id":"2009.05866","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-network-based-multi-agent","title":"Deep Q-Network Based Multi-agent Reinforcement Learning with Binary Action Agents","date":"2020-08-06","arxiv_id":"2008.04109","repositories_listed":0,"syntology":null},{"url":null,"slug":"easyrl-a-simple-and-extensible-reinforcement","title":"EasyRL: A Simple and Extensible Reinforcement Learning Framework","date":"2020-08-04","arxiv_id":"2008.01700","repositories_listed":0,"syntology":null},{"url":null,"slug":"evo-rl-evolutionary-driven-reinforcement","title":"EVO-RL: Evolutionary-Driven Reinforcement Learning","date":"2020-07-09","arxiv_id":"2007.04725","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-and-the-implementation-of-a-tool-to","title":"Concept and the implementation of a tool to convert industry 4.0 environments modeled as FSM to an OpenAI Gym wrapper","date":"2020-06-29","arxiv_id":"2006.16035","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-robust-reinforcement-learning-with","title":"Robust Reinforcement Learning using Least Squares Policy Iteration with Provable Performance Guarantees","date":"2020-06-20","arxiv_id":"2006.11608","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-estimation-bias-via-weighted-delayed","title":"WD3: Taming the Estimation Bias in Deep Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.12622","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-with-learned-dynamics","title":"Data Driven Control with Learned Dynamics: Model-Based versus Model-Free Approach","date":"2020-06-16","arxiv_id":"2006.09543","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-a-cartpole-system-with","title":"Balancing a CartPole System with Reinforcement Learning -- A Tutorial","date":"2020-06-08","arxiv_id":"2006.04938","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-continuous-control-of-ddpg-actors-via","title":"Refined Continuous Control of DDPG Actors via Parametrised Activation","date":"2020-06-04","arxiv_id":"2006.02818","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-fpga-based-on-device-reinforcement","title":"An FPGA-Based On-Device Reinforcement Learning Approach using Online Sequential Learning","date":"2020-05-10","arxiv_id":"2005.04646","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-using-weak-derivatives-for","title":"Policy Gradient using Weak Derivatives for Reinforcement Learning","date":"2020-04-09","arxiv_id":"2004.04843","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-actor-critic-gan-drl-actor-critic","title":"Model-based actor-critic: GAN (model generator) + DRL (actor-critic) => AGI","date":"2020-04-04","arxiv_id":"2004.04574","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-ai-interaction-loop-training-new","title":"Human AI interaction loop training: New approach for interactive reinforcement learning","date":"2020-03-09","arxiv_id":"2003.04203","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-policy-reuse-using-deep-mixture","title":"Contextual Policy Transfer in Reinforcement Learning Domains via Deep Mixtures-of-Experts","date":"2020-02-29","arxiv_id":"2003.00203","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-cloning-in-openai-using-case-based","title":"Behavior Cloning in OpenAI using Case Based Reasoning","date":"2020-02-23","arxiv_id":"2002.11197","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-temporal-difference-learning-with","title":"Adaptive Temporal Difference Learning with Linear Function Approximation","date":"2020-02-20","arxiv_id":"2002.08537","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-experience-selection-for-policy","title":"Adaptive Experience Selection for Policy Gradient","date":"2020-02-17","arxiv_id":"2002.06946","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-based-distributional-policy-gradient","title":"Sample-based Distributional Policy Gradient","date":"2020-01-08","arxiv_id":"2001.02652","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-droplet-routing-in-digital","title":"Adaptive Droplet Routing in Digital Microfluidic Biochips Using Deep Reinforcement Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"way-off-policy-batch-deep-reinforcement-1","title":"Way Off-Policy Batch Deep Reinforcement Learning of Human Preferences in Dialog","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-an-autonomous-surface-vehicle-for-path","title":"Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning","date":"2019-12-18","arxiv_id":"1912.08578","repositories_listed":0,"syntology":null},{"url":null,"slug":"sepsis-world-model-a-mimic-based-openai-gym","title":"Sepsis World Model: A MIMIC-based OpenAI Gym \"World Model\" Simulator for Sepsis Treatment","date":"2019-12-15","arxiv_id":"1912.07127","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-with","title":"Accelerating Reinforcement Learning with Suboptimal Guidance","date":"2019-11-21","arxiv_id":"1911.09391","repositories_listed":0,"syntology":null},{"url":null,"slug":"challenging-on-car-racing-problem-from-openai","title":"Challenging On Car Racing Problem from OpenAI gym","date":"2019-11-02","arxiv_id":"1911.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"zap-q-learning-with-nonlinear-function","title":"Zap Q-Learning With Nonlinear Function Approximation","date":"2019-10-11","arxiv_id":"1910.05405","repositories_listed":0,"syntology":null},{"url":null,"slug":"surreal-system-fully-integrated-stack-for","title":"SURREAL-System: Fully-Integrated Stack for Distributed Deep Reinforcement Learning","date":"2019-09-27","arxiv_id":"1909.12989","repositories_listed":0,"syntology":null},{"url":null,"slug":"advantage-weighted-regression-simple-and-1","title":"Advantage Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"moet-interpretable-and-verifiable-1","title":"MoET: Interpretable and Verifiable Reinforcement Learning via Mixture of Expert Trees","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"recommendation-system-based-upper-confidence","title":"Recommendation System-based Upper Confidence Bound for Online Advertising","date":"2019-09-09","arxiv_id":"1909.04190","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-memory-structure-for-efficient-use-of","title":"A Dual Memory Structure for Efficient Use of Replay Memory in Deep Reinforcement Learning","date":"2019-07-15","arxiv_id":"1907.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600131","title":"Decision-Making in Reinforcement Learning","date":"2019-06-01","arxiv_id":"1906.00131","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-q-matrix-transfer","title":"Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment","date":"2019-05-23","arxiv_id":"1905.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-support-of-over-parametrization-in-deep","title":"In Support of Over-Parametrization in Deep Reinforcement Learning: an Empirical Study","date":"2019-05-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-robotics-and","title":"Reinforcement Learning for Robotics and Control with Active Uncertainty Reduction","date":"2019-05-15","arxiv_id":"1905.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-artificial-intelligence-agents-for","title":"Design of Artificial Intelligence Agents for Games using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploration-strategy-for-self-1","title":"Adversarial Exploration Strategy for Self-Supervised Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simile-introducing-sequential-information","title":"SIMILE: Introducing Sequential Information towards More Effective Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-neural-networks-in-reinforcement","title":"Evolving Neural Networks in Reinforcement Learning by means of UMDAc","date":"2019-04-24","arxiv_id":"1904.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-combining-on-off-policy-methods-for","title":"Towards Combining On-Off-Policy Methods for Real-World Applications","date":"2019-04-24","arxiv_id":"1904.10642","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-brain-inspired-system-deep-recurrent","title":"Towards Brain-inspired System: Deep Recurrent Reinforcement Learning for Simulated Self-driving Agent","date":"2019-03-29","arxiv_id":"1903.12517","repositories_listed":0,"syntology":null},{"url":null,"slug":"dqn-with-model-based-exploration-efficient","title":"DQN with model-based exploration: efficient learning on environments with sparse rewards","date":"2019-03-22","arxiv_id":"1903.09295","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-characterizing-divergence-in-deep-q","title":"Towards Characterizing Divergence in Deep Q-Learning","date":"2019-03-21","arxiv_id":"1903.08894","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-gaussian-policies-from-corrective","title":"Learning Gaussian Policies from Corrective Human Feedback","date":"2019-03-12","arxiv_id":"1903.05216","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-experience-prioritization","title":"Curiosity-Driven Experience Prioritization via Density Estimation","date":"2019-02-20","arxiv_id":"1902.08039","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-a-prior-for-rhea-for-better-online","title":"Learn a Prior for RHEA for Better Online Planning","date":"2019-02-14","arxiv_id":"1902.05284","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-physically-safe-reinforcement","title":"Towards Physically Safe Reinforcement Learning under Supervision","date":"2019-01-19","arxiv_id":"1901.06576","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockpuzzle-a-challenge-in-physical-reasoning","title":"BlockPuzzle - A Challenge in Physical Reasoning and Generalization for Robot Learning","date":"2018-11-30","arxiv_id":"1812.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"relative-importance-sampling-for-off-policy","title":"Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning","date":"2018-10-30","arxiv_id":"1810.12558","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-learning-of-movement-prediction-in","title":"Sequential Learning of Movement Prediction in Dynamic Environments using LSTM Autoencoder","date":"2018-10-12","arxiv_id":"1810.05394","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-policies-using-inverse-rewards-for","title":"Hybrid Policies Using Inverse Rewards for Reinforcement Learning","date":"2018-09-27","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-isotropic-and-directional","title":"Switching Isotropic and Directional Exploration with Parameter Space Noise in Deep Reinforcement Learning","date":"2018-09-18","arxiv_id":"1809.06570","repositories_listed":0,"syntology":null},{"url":null,"slug":"genesys-enabling-continuous-learning-through","title":"GeneSys: Enabling Continuous Learning through Neural Network Evolution in Hardware","date":"2018-08-03","arxiv_id":"1808.01363","repositories_listed":0,"syntology":null},{"url":null,"slug":"fuzzergym-a-competitive-framework-for-fuzzing","title":"FuzzerGym: A Competitive Framework for Fuzzing and Learning","date":"2018-07-19","arxiv_id":"1807.07490","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-robust-policy-learning-in-the-presence","title":"Online Robust Policy Learning in the Presence of Unknown Adversaries","date":"2018-07-16","arxiv_id":"1807.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"qualitative-measurements-of-policy","title":"Qualitative Measurements of Policy Discrepancy for Return-Based Deep Q-Network","date":"2018-06-14","arxiv_id":"1806.06953","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-time-value-function-approximation","title":"Continuous-time Value Function Approximation in Reproducing Kernel Hilbert Spaces","date":"2018-06-08","arxiv_id":"1806.02985","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-distribution-aware-sampling-for-deep-q","title":"State Distribution-aware Sampling for Deep Q-learning","date":"2018-04-23","arxiv_id":"1804.08619","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-evolution-with-compact","title":"Structured Evolution with Compact Architectures for Scalable Policy Optimization","date":"2018-04-06","arxiv_id":"1804.02395","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-model-based-and-model-free-rl-via","title":"Combining Model-based and Model-free RL via Multi-step Control Variates","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-deep-recurrent-models-with","title":"Exploring Deep Recurrent Models with Reinforcement Learning for Molecule Design","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neuron-as-an-agent","title":"Neuron as an Agent","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/home-a-household-multimodal-environment","slug":"home-a-household-multimodal-environment","title":"HoME: a Household Multimodal Environment","date":"2017-11-29","arxiv_id":"1711.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"closing-the-loop-between-neural-network","title":"Closing the loop between neural network simulators and the OpenAI Gym","date":"2017-09-17","arxiv_id":"1709.05650","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-reinforcement-learning-agents","title":"Investigating Reinforcement Learning Agents for Continuous State Space Environments","date":"2017-08-08","arxiv_id":"1708.02378","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpolated-policy-gradient-merging-on","title":"Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning","date":"2017-06-01","arxiv_id":"1706.00387","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-markovian-control-with-gated-end-to-end","title":"Non-Markovian Control with Gated End-to-End Memory Policy Networks","date":"2017-05-31","arxiv_id":"1705.10993","repositories_listed":0,"syntology":null}],"record_sha256":"c5a2d2902617b7b897512a9ecbcb48a07825c9bd8a25692a707fff9cbbbb4b9b","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}