{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/openai-gym/papers/3","list_of":"/task/openai-gym","task":"OpenAI Gym","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":4,"rows_per_page":100,"rows":[201,300],"of":382,"counts":{"archive_papers_tagged":382,"with_a_code_link":179,"where_syntology_ran_a_sample":43,"not_listed_spam_title":0,"listed":382,"listed_where_code_ran":43,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":37,"every_run_a_failure_of_syntologys_instrument":6,"listed_with_a_run_with_no_instrument_failure":37,"listed_every_run_a_failure_of_syntologys_instrument":6,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/openai-gym","prev":"/task/openai-gym/papers/2","next":"/task/openai-gym/papers/4","papers":[{"url":null,"slug":"airlift-challenge-a-competition-for","title":"Airlift Challenge: A Competition for Optimizing Cargo Delivery","date":"2024-04-26","arxiv_id":"2404.17716","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-privacy-and-security-of-autonomous","title":"Enhancing Privacy and Security of Autonomous UAV Navigation","date":"2024-04-26","arxiv_id":"2404.17225","repositories_listed":0,"syntology":null},{"url":null,"slug":"homelabgym-a-real-world-testbed-for-home","title":"HomeLabGym: A real-world testbed for home energy management systems","date":"2024-04-22","arxiv_id":"2404.14110","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-spiking-actor-network-for-exploration","title":"Noisy Spiking Actor Network for Exploration","date":"2024-03-07","arxiv_id":"2403.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-fox-learning-breaking-tradition-in","title":"QF-tuner: Breaking Tradition in Reinforcement Learning","date":"2024-02-26","arxiv_id":"2402.16562","repositories_listed":0,"syntology":null},{"url":null,"slug":"easy-as-abcs-unifying-boltzmann-q-learning","title":"Easy as ABCs: Unifying Boltzmann Q-Learning and Counterfactual Regret Minimization","date":"2024-02-19","arxiv_id":"2402.11835","repositories_listed":0,"syntology":null},{"url":null,"slug":"scilab-rl-a-software-framework-for-efficient","title":"Scilab-RL: A software framework for efficient reinforcement learning and cognitive modeling research","date":"2024-01-25","arxiv_id":"2401.14488","repositories_listed":0,"syntology":null},{"url":null,"slug":"multislot-reranker-a-generic-model-based-re","title":"MultiSlot ReRanker: A Generic Model-based Re-Ranking Framework in Recommendation Systems","date":"2024-01-11","arxiv_id":"2401.06293","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-closed-loop-multi-perspective-visual","title":"A Closed-Loop Multi-perspective Visual Servoing Approach with Reinforcement Learning","date":"2023-12-25","arxiv_id":"2312.15809","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-control-of-networked-microgrids","title":"Resilient Control of Networked Microgrids using Vertical Federated Reinforcement Learning: Designs and Real-Time Test-Bed Validations","date":"2023-11-21","arxiv_id":"2311.12264","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-impact-on-identifying","title":"Neural architecture impact on identifying temporally extended Reinforcement Learning tasks","date":"2023-10-04","arxiv_id":"2310.03161","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-budget-black-box-optimization-algorithms","title":"Optimizing with Low Budgets: a Comparison on the Black-box Optimization Benchmarking Suite and OpenAI Gym","date":"2023-09-29","arxiv_id":"2310.00077","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-sensing-in-traffic-optimization","title":"Implicit Sensing in Traffic Optimization: Advanced Deep Reinforcement Learning Techniques","date":"2023-09-25","arxiv_id":"2309.14395","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-saturation-gymnasium-environments-for","title":"gym-saturation: Gymnasium environments for saturation provers (System description)","date":"2023-09-16","arxiv_id":"2309.09022","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-loss-adjusted-prioritized","title":"Attention Loss Adjusted Prioritized Experience Replay","date":"2023-09-13","arxiv_id":"2309.06684","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-statistical","title":"Distributionally Robust Statistical Verification with Imprecise Neural Networks","date":"2023-08-28","arxiv_id":"2308.14815","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistically-efficient-variance-reduction","title":"Statistically Efficient Variance Reduction with Double Policy Estimation for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning","date":"2023-08-28","arxiv_id":"2308.14897","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-combining-expert-demonstrations-in","title":"On Combining Expert Demonstrations in Imitation Learning via Optimal Transport","date":"2023-07-20","arxiv_id":"2307.10810","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-distributed-multi-task-reinforcement","title":"Scaling Distributed Multi-task Reinforcement Learning with Experience Sharing","date":"2023-07-11","arxiv_id":"2307.05834","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-environment-models-with-continuous","title":"Learning Environment Models with Continuous Stochastic Dynamics","date":"2023-06-29","arxiv_id":"2306.17204","repositories_listed":0,"syntology":null},{"url":null,"slug":"correcting-discount-factor-mismatch-in-on","title":"Correcting discount-factor mismatch in on-policy policy gradient methods","date":"2023-06-23","arxiv_id":"2306.13284","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-esg-financial","title":"Deep Reinforcement Learning for ESG financial portfolio management","date":"2023-06-19","arxiv_id":"2307.09631","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-inference-in-hebbian-learning-networks","title":"Active Inference in Hebbian Learning Networks","date":"2023-06-08","arxiv_id":"2306.05053","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-individual-rewards-in-collective","title":"Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10548","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-population-assisted-off-policy","title":"Rethinking Population-assisted Off-policy Reinforcement Learning","date":"2023-05-04","arxiv_id":"2305.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-precice-reinforcement-learning","title":"Gym-preCICE: Reinforcement Learning Environments for Active Flow Control","date":"2023-05-03","arxiv_id":"2305.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"exact-and-cost-effective-automated","title":"Exact and Cost-Effective Automated Transformation of Neural Network Controllers to Decision Tree Controllers","date":"2023-04-11","arxiv_id":"2304.06049","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-repair-of-learning-enabled-cyber","title":"Causal Repair of Learning-enabled Cyber-physical Systems","date":"2023-04-06","arxiv_id":"2304.02813","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-strategy-oriented-bayesian-soft-actor","title":"A Strategy-Oriented Bayesian Soft Actor-Critic Model","date":"2023-03-07","arxiv_id":"2303.04193","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-decision-transformer","title":"Graph Decision Transformer","date":"2023-03-07","arxiv_id":"2303.03747","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-environment-poisoning-attacks-on","title":"Local Environment Poisoning Attacks on Federated Reinforcement Learning","date":"2023-03-05","arxiv_id":"2303.02725","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-a3c-deep-reinforcement-learning-on","title":"Double A3C: Deep Reinforcement Learning on OpenAI Gym Games","date":"2023-03-04","arxiv_id":"2303.02271","repositories_listed":0,"syntology":null},{"url":"/paper/average-constrained-policy-optimization","slug":"average-constrained-policy-optimization","title":"ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints","date":"2023-02-02","arxiv_id":"2302.00808","repositories_listed":0,"syntology":{"n":12,"n_ran":5,"n_constructed":0,"n_ran_checked":4,"n_instrument":1,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":4,"n_pointer_only":4,"phrase":"5 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 0 honoured, 0 violated, 4 with no contract checked; 1 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/average-constrained-policy-optimization#ran","syntology_url":"https://syntology.ai/paper/2302.00808","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2302.00808"}},"official":null}},{"url":null,"slug":"neural-episodic-control-with-state","title":"Neural Episodic Control with State Abstraction","date":"2023-01-27","arxiv_id":"2301.11490","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-deep-double-duelling-q-learning","title":"Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets","date":"2023-01-20","arxiv_id":"2301.08688","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-reinforcement-learning-with-loss","title":"Off-Policy Reinforcement Learning with Loss Function Weighted by Temporal Difference Error","date":"2022-12-26","arxiv_id":"2212.13175","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-cyber-resilience-of-networked","title":"Enhancing Cyber Resilience of Networked Microgrids using Vertical Federated Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08973","repositories_listed":0,"syntology":null},{"url":null,"slug":"ct-dqn-control-tutored-deep-reinforcement","title":"CT-DQN: Control-Tutored Deep Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"sufficient-exploration-for-convex-q-learning","title":"Sufficient Exploration for Convex Q-learning","date":"2022-10-17","arxiv_id":"2210.09409","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-n-step-surrogate-stage-reward-to-reduce","title":"Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems","date":"2022-10-10","arxiv_id":"2210.04820","repositories_listed":0,"syntology":null},{"url":null,"slug":"elastic-step-dqn-a-novel-multi-step-algorithm","title":"Elastic Step DQN: A novel multi-step algorithm to alleviate overestimation in Deep QNetworks","date":"2022-10-07","arxiv_id":"2210.03325","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-for-multi","title":"Reinforcement Learning Approach for Multi-Agent Flexible Scheduling Problems","date":"2022-10-07","arxiv_id":"2210.03674","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-strategy-for","title":"A Deep Reinforcement Learning Strategy for UAV Autonomous Landing on a Platform","date":"2022-09-07","arxiv_id":"2209.02954","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-deep-rl-models-into-interpretable","title":"Distilling Deep RL Models Into Interpretable Neuro-Fuzzy Systems","date":"2022-09-07","arxiv_id":"2209.03357","repositories_listed":0,"syntology":null},{"url":null,"slug":"cluster-based-sampling-in-hindsight","title":"Cluster-based Sampling in Hindsight Experience Replay for Robotic Tasks (Student Abstract)","date":"2022-08-31","arxiv_id":"2208.14741","repositories_listed":0,"syntology":null},{"url":null,"slug":"marti-4-new-model-of-human-brain-considering","title":"MARTI-4: new model of human brain, considering neocortex and basal ganglia -- learns to play Atari game by reinforcement learning on a single CPU","date":"2022-08-18","arxiv_id":"2209.02387","repositories_listed":0,"syntology":null},{"url":null,"slug":"quality-diversity-evolutionary-learning-of","title":"Quality Diversity Evolutionary Learning of Decision Trees","date":"2022-08-17","arxiv_id":"2208.12758","repositories_listed":0,"syntology":null},{"url":null,"slug":"implicit-two-tower-policies","title":"Implicit Two-Tower Policies","date":"2022-08-02","arxiv_id":"2208.01191","repositories_listed":0,"syntology":null},{"url":null,"slug":"rangl-a-reinforcement-learning-competition","title":"RangL: A Reinforcement Learning Competition Platform","date":"2022-07-28","arxiv_id":"2208.00003","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-non-reinforced-preferences-using","title":"Modelling non-reinforced preferences using selective attention","date":"2022-07-25","arxiv_id":"2207.13699","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-sparse-rewards-in-continuous","title":"Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies","date":"2022-06-12","arxiv_id":"2206.05652","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-body-shape-search-for-legged","title":"Adversarial Body Shape Search for Legged Robots","date":"2022-05-20","arxiv_id":"2205.10187","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-joint-attacks-on-legged-robots","title":"Adversarial joint attacks on legged robots","date":"2022-05-20","arxiv_id":"2205.10098","repositories_listed":0,"syntology":null},{"url":null,"slug":"mr-inet-gym-framework-for-edge-deployment-of","title":"MR-iNet Gym: Framework for Edge Deployment of Deep Reinforcement Learning on Embedded Software Defined Radio","date":"2022-04-09","arxiv_id":"2204.04507","repositories_listed":0,"syntology":null},{"url":null,"slug":"remember-and-forget-experience-replay-for","title":"Remember and Forget Experience Replay for Multi-Agent Reinforcement Learning","date":"2022-03-24","arxiv_id":"2203.13319","repositories_listed":0,"syntology":null},{"url":null,"slug":"lean-evolutionary-reinforcement-learning-by","title":"Multitask Neuroevolution for Reinforcement Learning with Long and Short Episodes","date":"2022-03-21","arxiv_id":"2203.10844","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-saturation-an-openai-gym-environment-for","title":"Gym-saturation: an OpenAI Gym environment for saturation provers","date":"2022-03-09","arxiv_id":"2203.04699","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-convergence-of-primal-dual","title":"Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation","date":"2022-02-28","arxiv_id":"2202.13863","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-actor-critic-with-inhibitory-networks-1","title":"Soft Actor-Critic with Inhibitory Networks for Faster Retraining","date":"2022-02-07","arxiv_id":"2202.02918","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-temporal-difference","title":"Differentially Private Temporal Difference Learning with Stochastic Nonconvex-Strongly-Concave Optimization","date":"2022-01-25","arxiv_id":"2201.10447","repositories_listed":0,"syntology":null},{"url":null,"slug":"direct-mutation-and-crossover-in-genetic","title":"Direct Mutation and Crossover in Genetic Algorithms Applied to Reinforcement Learning Tasks","date":"2022-01-13","arxiv_id":"2201.04815","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-surrogate-assisted-controller-for-expensive","title":"A Surrogate-Assisted Controller for Expensive Evolutionary Reinforcement Learning","date":"2022-01-01","arxiv_id":"2201.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-via","title":"Multi-Agent Reinforcement Learning via Adaptive Kalman Temporal Difference and Successor Representation","date":"2021-12-30","arxiv_id":"2112.15156","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-a-robot-to-walk-using-reinforcement","title":"Teaching a Robot to Walk Using Reinforcement Learning","date":"2021-12-13","arxiv_id":"2112.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-tutored-reinforcement-learning-1","title":"Control-Tutored Reinforcement Learning: Towards the Integration of Data-Driven and Model-Based Control","date":"2021-12-11","arxiv_id":"2112.06018","repositories_listed":0,"syntology":null},{"url":null,"slug":"visualenv-visual-gym-environments-with","title":"VisualEnv: visual Gym environments with Blender","date":"2021-11-15","arxiv_id":"2111.08096","repositories_listed":0,"syntology":null},{"url":null,"slug":"awd3-dynamic-reduction-of-the-estimation-bias","title":"AWD3: Dynamic Reduction of the Estimation Bias","date":"2021-11-12","arxiv_id":"2111.06780","repositories_listed":0,"syntology":null},{"url":null,"slug":"drivergym-democratising-reinforcement","title":"DriverGym: Democratising Reinforcement Learning for Autonomous Driving","date":"2021-11-12","arxiv_id":"2111.06889","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-optimization-with-continuous","title":"Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution","date":"2021-11-03","arxiv_id":"2111.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-aided-crop-yield","title":"Machine Learning aided Crop Yield Optimization","date":"2021-11-01","arxiv_id":"2111.00963","repositories_listed":0,"syntology":null},{"url":null,"slug":"desta-a-framework-for-safe-reinforcement-1","title":"DESTA: A Framework for Safe Reinforcement Learning with Markov Games of Intervention","date":"2021-10-27","arxiv_id":"2110.14468","repositories_listed":0,"syntology":null},{"url":null,"slug":"rein-2-giving-birth-to-prepared-reinforcement","title":"REIN-2: Giving Birth to Prepared Reinforcement Learning Agents Using Reinforcement Learning Agents","date":"2021-10-11","arxiv_id":"2110.05128","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-policy-reinforcement-learning","title":"Compositional Q-learning for electrolyte repletion with imbalanced patient sub-populations","date":"2021-10-06","arxiv_id":"2110.02879","repositories_listed":0,"syntology":null},{"url":null,"slug":"imaginary-hindsight-experience-replay-curious","title":"Imaginary Hindsight Experience Replay: Curious Model-based Learning for Sparse Reward Tasks","date":"2021-10-05","arxiv_id":"2110.02414","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-algorithms-from-machine-learning","title":"Benchmarking Algorithms from Machine Learning for Low-Budget Black-Box Optimization","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"crowdplay-crowdsourcing-human-demonstration","title":"CrowdPlay: Crowdsourcing human demonstration data for offline learning in Atari games","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-more-when-it-s-a-key","title":"Experience Replay More When It's a Key Transition in Deep Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-driven-coordinate-ascent-for","title":"Hypothesis Driven Coordinate Ascent for Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-policy-reinforcement-learning-for","title":"Nested Policy Reinforcement Learning for Clinical Decision Support","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"untangling-braids-with-multi-agent-q-learning","title":"Untangling Braids with Multi-agent Q-Learning","date":"2021-09-29","arxiv_id":"2109.14502","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-did-you-learn-that-from-surprising","title":"Membership Inference Attacks Against Temporally Correlated Data in Deep Reinforcement Learning","date":"2021-09-08","arxiv_id":"2109.03975","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-oracle-and-observations-for-the-openai-gym","title":"An Oracle and Observations for the OpenAI Gym / ALE Freeway Environment","date":"2021-09-02","arxiv_id":"2109.01220","repositories_listed":0,"syntology":null},{"url":null,"slug":"photonic-quantum-policy-learning-in-openai","title":"Photonic Quantum Policy Learning in OpenAI Gym","date":"2021-08-29","arxiv_id":"2108.12926","repositories_listed":0,"syntology":null},{"url":null,"slug":"influence-based-reinforcement-learning-for","title":"Influence-Based Reinforcement Learning for Intrinsically-Motivated Agents","date":"2021-08-28","arxiv_id":"2108.12581","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-independent-study-of-reinforcement","title":"An Independent Study of Reinforcement Learning and Autonomous Driving","date":"2021-08-20","arxiv_id":"2110.07729","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-reinforcement-learning-for","title":"An Analysis of Reinforcement Learning for Malaria Control","date":"2021-07-19","arxiv_id":"2107.08988","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-coding-and-dynamic-neurons","title":"Population-coding and Dynamic-neurons improved Spiking Actor Network for Reinforcement Learning","date":"2021-06-15","arxiv_id":"2106.07854","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-inverse-reinforcement-learning","title":"Offline Inverse Reinforcement Learning","date":"2021-06-09","arxiv_id":"2106.05068","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-and-preference-satisfaction-trade","title":"Exploration and preference satisfaction trade-off in reward-free learning","date":"2021-06-08","arxiv_id":"2106.04316","repositories_listed":0,"syntology":null},{"url":null,"slug":"appbuddy-learning-to-accomplish-tasks-in","title":"AppBuddy: Learning to Accomplish Tasks in Mobile Apps via Reinforcement Learning","date":"2021-05-31","arxiv_id":"2106.00133","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-generalised-inverse-reinforcement-learning","title":"A Generalised Inverse Reinforcement Learning Framework","date":"2021-05-25","arxiv_id":"2105.11812","repositories_listed":0,"syntology":null},{"url":null,"slug":"affine-transport-for-sim-to-real-domain","title":"Affine Transport for Sim-to-Real Domain Adaptation","date":"2021-05-25","arxiv_id":"2105.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-an-inverted-pendulum-with-policy","title":"Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial","date":"2021-05-17","arxiv_id":"2105.07998","repositories_listed":0,"syntology":null},{"url":null,"slug":"rail-a-modular-framework-for-reinforcement","title":"RAIL: A modular framework for Reinforcement-learning-based Adversarial Imitation Learning","date":"2021-05-08","arxiv_id":"2105.03756","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-skipped-frames-in-action-repeats","title":"Utilizing Skipped Frames in Action Repeats via Pseudo-Actions","date":"2021-05-07","arxiv_id":"2105.03041","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementing-reinforcement-learning","title":"Implementing Reinforcement Learning Algorithms in Retail Supply Chains with OpenAI Gym Toolkit","date":"2021-04-27","arxiv_id":"2104.14398","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-using-guided","title":"Reinforcement Learning using Guided Observability","date":"2021-04-22","arxiv_id":"2104.10986","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimism-is-all-you-need-model-based-1","title":"Optimism is All You Need: Model-Based Imitation Learning From Observation Alone","date":"2021-03-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-domain-knowledge-with-an-adviser","title":"Transferring Domain Knowledge with an Adviser in Continuous Tasks","date":"2021-02-16","arxiv_id":"2102.08029","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-demonstrations-using-signal","title":"Learning from Demonstrations using Signal Temporal Logic","date":"2021-02-15","arxiv_id":"2102.07730","repositories_listed":0,"syntology":null}],"record_sha256":"061b043ed453c7c4763067f4075655e2abd71e48ab7869473fad3e6cb9a52943","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}