{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/replaybuffer","entry":"ReplayBuffer","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":33,"n_papers_ran":23,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":83,"n_samples_ran":59,"n_samples_fingerprinted":1,"n_places":83,"n_places_pointer_only":43,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":59,"unverified":24},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.11658","paper":"/paper/arxiv-2608-11658","title":"Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"RS2002/MA-USFA","path":"tsc/agent.py","file_url":"https://github.com/RS2002/MA-USFA/blob/HEAD/tsc/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cfc56b7bea4330e3","mcp_get_code":{"code_sha256":"cfc56b7bea4330e3"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"sfujim/BCQ","path":"discrete_BCQ/utils.py","file_url":"https://github.com/sfujim/BCQ/blob/HEAD/discrete_BCQ/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2a282db4ff509a1c","mcp_get_code":{"code_sha256":"2a282db4ff509a1c"}},{"arxiv_id":"2608.01793","paper":"/paper/arxiv-2608-01793","title":"ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"CLendering/ReFP-AD","path":"pipeline.py","file_url":"https://github.com/CLendering/ReFP-AD/blob/HEAD/pipeline.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"91230af41ce76aa9","mcp_get_code":{"code_sha256":"91230af41ce76aa9"}},{"arxiv_id":"2606.09869","paper":"/paper/arxiv-2606-09869","title":"QSplitFL: Capability Aware Deep Q-Learning for Optimal Split Point Selection in Split Federated Learning Nazmus Shakib Shadin 1[0000-0002-0999-924X] , Xinyue Zhang 1[0000-0002-4243-083X] , Jingyi Wang 2[0000-0002-4988-5626] , and Miao Pan 3[0000-0003-2138-4413]","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"AIPO-Lab/QSplitFL","path":"Capability_Aware_DQN_Implementation/dqn_split_agent.py","file_url":"https://github.com/AIPO-Lab/QSplitFL/blob/HEAD/Capability_Aware_DQN_Implementation/dqn_split_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e02b292fe78a631c","mcp_get_code":{"code_sha256":"e02b292fe78a631c"}},{"arxiv_id":"2605.11711","paper":"/paper/arxiv-2605-11711","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"dmksjfl/DR.Q","path":"DRQ/DRQ.py","file_url":"https://github.com/dmksjfl/DR.Q/blob/HEAD/DRQ/DRQ.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5ef134cb3440fdcb","mcp_get_code":{"code_sha256":"5ef134cb3440fdcb"}},{"arxiv_id":"2605.05863","paper":"/paper/arxiv-2605-05863","title":"SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"CarloRomeo427/SOPE","path":"src/algos/agent_sope.py","file_url":"https://github.com/CarloRomeo427/SOPE/blob/HEAD/src/algos/agent_sope.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"068b007d0eb9bea3","mcp_get_code":{"code_sha256":"068b007d0eb9bea3"}},{"arxiv_id":"2604.19146","paper":"/paper/arxiv-2604-19146","title":"RL-ABC: Reinforcement Learning for Accelerator Beamline Control","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Anwar9Ibrahim/RL-ABC","path":"rl_framework/Agents/DDPG.py","file_url":"https://github.com/Anwar9Ibrahim/RL-ABC/blob/HEAD/rl_framework/Agents/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"208064288fc2783c","mcp_get_code":{"code_sha256":"208064288fc2783c"}},{"arxiv_id":"2603.19551","paper":"/paper/arxiv-2603-19551","title":"Learning to Bet for Horizon-Aware Anytime-Valid Testing","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"egetaga/learning-to-bet","path":"dqn/models.py","file_url":"https://github.com/egetaga/learning-to-bet/blob/HEAD/dqn/models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"906383c6649dbfea","mcp_get_code":{"code_sha256":"906383c6649dbfea"}},{"arxiv_id":"2506.12622","paper":"/paper/dr-sac-distributionally-robust-soft-actor","title":"DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty","date":"2025-06-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lemutisme/dr-sac","path":"sac.py","file_url":"https://github.com/lemutisme/dr-sac/blob/HEAD/sac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"45c5e6c336c21050","mcp_get_code":{"code_sha256":"45c5e6c336c21050"}},{"arxiv_id":"2501.16142","paper":"/paper/towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/MRQ","path":"MRQ/MRQ.py","file_url":"https://github.com/facebookresearch/MRQ/blob/HEAD/MRQ/MRQ.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"39dd84fd5db384b3","mcp_get_code":{"code_sha256":"39dd84fd5db384b3"}},{"arxiv_id":"2408.01972","paper":"/paper/rvi-sac-average-reward-off-policy-deep","title":"RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning","date":"2024-08-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yhisaki/average-reward-drl","path":"average_reward_drl/algorithms/rvi_sac.py","file_url":"https://github.com/yhisaki/average-reward-drl/blob/HEAD/average_reward_drl/algorithms/rvi_sac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6e334ad3a7618566","mcp_get_code":{"code_sha256":"6e334ad3a7618566"}},{"arxiv_id":"2405.19961","paper":"/paper/collective-variable-free-transition-path","title":"Transition Path Sampling with Improved Off-Policy Training of Diffusion Path Samplers","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kiyoung98/tps-dps","path":"src/dps.py","file_url":"https://github.com/kiyoung98/tps-dps/blob/HEAD/src/dps.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"564a155eb9ec3bee","mcp_get_code":{"code_sha256":"564a155eb9ec3bee"}},{"arxiv_id":"2405.17477","paper":"/paper/ollie-imitation-learning-from-offline","title":"OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hansenhua/ollie-offline-to-online-imitation-learning","path":"offline_to_online.py","file_url":"https://github.com/hansenhua/ollie-offline-to-online-imitation-learning/blob/HEAD/offline_to_online.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"edb756571764039b","mcp_get_code":{"code_sha256":"edb756571764039b"}},{"arxiv_id":"2402.06121","paper":"/paper/iterated-denoising-energy-matching-for","title":"Iterated Denoising Energy Matching for Sampling from Boltzmann Densities","date":"2024-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jarridrb/dem","path":"dem/models/components/sde_integration.py","file_url":"https://github.com/jarridrb/dem/blob/HEAD/dem/models/components/sde_integration.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c0238358b3127562","mcp_get_code":{"code_sha256":"c0238358b3127562"}},{"arxiv_id":"2402.05439","paper":"/paper/learning-uncertainty-aware-temporally","title":"Learning Uncertainty-Aware Temporally-Extended Actions","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"oh-lab/UTE-Uncertainty-aware-Temporal-Extension-","path":"chain_mdp/agent/temporal_extension.py","file_url":"https://github.com/oh-lab/UTE-Uncertainty-aware-Temporal-Extension-/blob/HEAD/chain_mdp/agent/temporal_extension.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5023894548dbacbb","mcp_get_code":{"code_sha256":"5023894548dbacbb"}},{"arxiv_id":"2402.03141","paper":"/paper/boosting-long-delayed-reinforcement-learning","title":"Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays","date":"2024-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qingyuanwunothing/ad-rl","path":"AD-DQN.py","file_url":"https://github.com/qingyuanwunothing/ad-rl/blob/HEAD/AD-DQN.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"68200fece3c9d915","mcp_get_code":{"code_sha256":"68200fece3c9d915"}},{"arxiv_id":"2310.18803","paper":"/paper/weakly-coupled-deep-q-networks","title":"Weakly Coupled Deep Q-Networks","date":"2023-10-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ibrahim-elshar/WCDQN_NeurIPS","path":"src/Inv_control/WCDQN.py","file_url":"https://github.com/ibrahim-elshar/WCDQN_NeurIPS/blob/HEAD/src/Inv_control/WCDQN.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0a34c84d33066fee","mcp_get_code":{"code_sha256":"0a34c84d33066fee"}},{"arxiv_id":"2307.08875","paper":"/paper/natural-actor-critic-for-robust-reinforcement","title":"Natural Actor-Critic for Robust Reinforcement Learning with Function Approximation","date":"2023-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tliu1997/rnac","path":"train_rnac.py","file_url":"https://github.com/tliu1997/rnac/blob/HEAD/train_rnac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"31b7a842f737b97e","mcp_get_code":{"code_sha256":"31b7a842f737b97e"}},{"arxiv_id":"2304.13774","paper":"/paper/distance-weighted-supervised-learning-for","title":"Distance Weighted Supervised Learning for Offline Interaction Data","date":"2023-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jhejna/dwsl","path":"research/algs/dwsl.py","file_url":"https://github.com/jhejna/dwsl/blob/HEAD/research/algs/dwsl.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"377a3792bec4c050","mcp_get_code":{"code_sha256":"377a3792bec4c050"}},{"arxiv_id":"2211.03413","paper":"/paper/max-min-off-policy-actor-critic-method","title":"Max-Min Off-Policy Actor-Critic Method Focusing on Worst-Case Robustness to Model Misspecification","date":"2022-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"akimotolab/m2td3","path":"M2TD3/m2td3.py","file_url":"https://github.com/akimotolab/m2td3/blob/HEAD/M2TD3/m2td3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"badc218c65d7931c","mcp_get_code":{"code_sha256":"badc218c65d7931c"}},{"arxiv_id":"2209.12782","paper":"/paper/learning-gflownets-from-partial-episodes-for","title":"Learning GFlowNets from partial episodes for improved convergence and stability","date":"2022-09-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gfnorg/gflownet","path":"grid/toy_grid_dag.py","file_url":"https://github.com/gfnorg/gflownet/blob/HEAD/grid/toy_grid_dag.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d00f3663f26789a6","mcp_get_code":{"code_sha256":"d00f3663f26789a6"}},{"arxiv_id":"2110.02034","paper":"/paper/dropout-q-functions-for-doubly-efficient","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","date":"2021-10-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"watchernyu/REDQ","path":"redq/algos/redq_sac.py","file_url":"https://github.com/watchernyu/REDQ/blob/HEAD/redq/algos/redq_sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"820da6f0b914ce98","mcp_get_code":{"code_sha256":"820da6f0b914ce98"}},{"arxiv_id":"2008.06043","paper":"/paper/offline-meta-reinforcement-learning-with","title":"Offline Meta-Reinforcement Learning with Advantage Weighting","date":"2020-08-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eric-mitchell/macaw-min","path":"impl.py","file_url":"https://github.com/eric-mitchell/macaw-min/blob/HEAD/impl.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"02080cb75a3041f8","mcp_get_code":{"code_sha256":"02080cb75a3041f8"}},{"arxiv_id":"2007.06049","paper":"/paper/an-equivalence-between-loss-functions-and-non","title":"An Equivalence between Loss Functions and Non-Uniform Sampling in Experience Replay","date":"2020-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/LAP-PAL","path":"discrete/utils.py","file_url":"https://github.com/sfujim/LAP-PAL/blob/HEAD/discrete/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d60cce6245a34fcb","mcp_get_code":{"code_sha256":"d60cce6245a34fcb"}},{"arxiv_id":"2006.07442","paper":"/paper/self-imitation-learning-via-generalized-lower","title":"Self-Imitation Learning via Generalized Lower Bound Q-learning","date":"2020-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"junhyukoh/self-imitation-learning","path":"baselines/common/self_imitation.py","file_url":"https://github.com/junhyukoh/self-imitation-learning/blob/HEAD/baselines/common/self_imitation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"92fcff634a9f6c9e","mcp_get_code":{"code_sha256":"92fcff634a9f6c9e"}},{"arxiv_id":"2002.08030","paper":"/paper/transfer-among-agents-an-efficient-multiagent-1","title":"An Efficient Transfer Learning Framework for Multiagent Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2020-02","title_source":"archive","repo":"tianpeiyang/maptf_code","path":"alg/option/option_ma_sro.py","file_url":"https://github.com/tianpeiyang/maptf_code/blob/HEAD/alg/option/option_ma_sro.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a6dfa17c8b218bdd","mcp_get_code":{"code_sha256":"a6dfa17c8b218bdd"}},{"arxiv_id":"1912.01603","paper":"/paper/dream-to-control-learning-behaviors-by-latent","title":"Dream to Control: Learning Behaviors by Latent Imagination","date":"2019-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhixuan-lin/dreamer-pytorch","path":"dreamer.py","file_url":"https://github.com/zhixuan-lin/dreamer-pytorch/blob/HEAD/dreamer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8c761148be72a1af","mcp_get_code":{"code_sha256":"8c761148be72a1af"}},{"arxiv_id":"1912.01603","paper":"/paper/dream-to-control-learning-behaviors-by-latent","title":"Dream to Control: Learning Behaviors by Latent Imagination","date":"2019-12-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adityabingi/Dreamer","path":"dreamer.py","file_url":"https://github.com/adityabingi/Dreamer/blob/HEAD/dreamer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9250128488be37e8","mcp_get_code":{"code_sha256":"9250128488be37e8"}},{"arxiv_id":"1911.08265","paper":"/paper/mastering-atari-go-chess-and-shogi-by","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","date":"2019-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dmiracle/muzero-starter","path":"pseudocode.py","file_url":"https://github.com/dmiracle/muzero-starter/blob/HEAD/pseudocode.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6ff1fe24a95ea773","mcp_get_code":{"code_sha256":"6ff1fe24a95ea773"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning","path":"src/agents.py","file_url":"https://github.com/MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning/blob/HEAD/src/agents.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ac5ecca5b7705f8a","mcp_get_code":{"code_sha256":"ac5ecca5b7705f8a"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kdally/fault-tolerant-flight-control-drl","path":"fault_tolerant_flight_control_drl/agent/sac.py","file_url":"https://github.com/kdally/fault-tolerant-flight-control-drl/blob/HEAD/fault_tolerant_flight_control_drl/agent/sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8119b0afbe2d940e","mcp_get_code":{"code_sha256":"8119b0afbe2d940e"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Soft-Actor-Critic-and-Extensions","path":"files/Agent.py","file_url":"https://github.com/BY571/Soft-Actor-Critic-and-Extensions/blob/HEAD/files/Agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a6c39d1200737d3f","mcp_get_code":{"code_sha256":"a6c39d1200737d3f"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yhisaki/average-reward-drl","path":"average_reward_drl/algorithms/sac.py","file_url":"https://github.com/yhisaki/average-reward-drl/blob/HEAD/average_reward_drl/algorithms/sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e9664791458e5ade","mcp_get_code":{"code_sha256":"e9664791458e5ade"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"quantumiracle/Popular-RL-Algorithms","path":"sac_v2.py","file_url":"https://github.com/quantumiracle/Popular-RL-Algorithms/blob/HEAD/sac_v2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"70249df825c62d7e","mcp_get_code":{"code_sha256":"70249df825c62d7e"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thomashirtz/soft-actor-critic","path":"soft_actor_critic/agent.py","file_url":"https://github.com/thomashirtz/soft-actor-critic/blob/HEAD/soft_actor_critic/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0020d85f4dbfb10b","mcp_get_code":{"code_sha256":"0020d85f4dbfb10b"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrDaubinet/collaboration-and-competition","path":"maddpg.py","file_url":"https://github.com/MrDaubinet/collaboration-and-competition/blob/HEAD/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ae26aa48075ee6cb","mcp_get_code":{"code_sha256":"ae26aa48075ee6cb"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baradist/multiagent-particle-envs","path":"multiagent/ddpg/ddpg_agent.py","file_url":"https://github.com/baradist/multiagent-particle-envs/blob/HEAD/multiagent/ddpg/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c90519f77627be1f","mcp_get_code":{"code_sha256":"c90519f77627be1f"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"krasing/DRLearningCollaboration","path":"failed_collaborative/ddpg_agent_multi_2.py","file_url":"https://github.com/krasing/DRLearningCollaboration/blob/HEAD/failed_collaborative/ddpg_agent_multi_2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4cbc44a206f6120a","mcp_get_code":{"code_sha256":"4cbc44a206f6120a"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/MADDPG_Tennis_UnityML","path":"MADDPG.py","file_url":"https://github.com/bonniesjli/MADDPG_Tennis_UnityML/blob/HEAD/MADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"21d74b782714cf9e","mcp_get_code":{"code_sha256":"21d74b782714cf9e"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baoqianwang/iros22_darl1n","path":"maddpg_o/maddpg_local/trainer/maddpg.py","file_url":"https://github.com/baoqianwang/iros22_darl1n/blob/HEAD/maddpg_o/maddpg_local/trainer/maddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0ec668ec81ebce4d","mcp_get_code":{"code_sha256":"0ec668ec81ebce4d"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"EyaRhouma/collaboration-competition-MADDPG","path":"MADDPG_agent.py","file_url":"https://github.com/EyaRhouma/collaboration-competition-MADDPG/blob/HEAD/MADDPG_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0fe6e65cdf5950a9","mcp_get_code":{"code_sha256":"0fe6e65cdf5950a9"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CharlotteMorrison/Baxter-Research","path":"td3algorithm/priority-replay/prioritized_replay_buffer.py","file_url":"https://github.com/CharlotteMorrison/Baxter-Research/blob/HEAD/td3algorithm/priority-replay/prioritized_replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e13397d005876228","mcp_get_code":{"code_sha256":"e13397d005876228"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"emiled16/Beyond_prioritized_experience_replay","path":"final_buffer.py","file_url":"https://github.com/emiled16/Beyond_prioritized_experience_replay/blob/HEAD/final_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4dfb2bb869a28e56","mcp_get_code":{"code_sha256":"4dfb2bb869a28e56"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CharlotteMorrison/Baxter-VREP","path":"td3/experience/priority_replay_buffer.py","file_url":"https://github.com/CharlotteMorrison/Baxter-VREP/blob/HEAD/td3/experience/priority_replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c2cbd2d0d7d66167","mcp_get_code":{"code_sha256":"c2cbd2d0d7d66167"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tensorlayer/RLzoo","path":"rlzoo/common/buffer.py","file_url":"https://github.com/tensorlayer/RLzoo/blob/HEAD/rlzoo/common/buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f4455aa8614ee649","mcp_get_code":{"code_sha256":"f4455aa8614ee649"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"atavakol/action-branching-agents","path":"agents/bdq/deepq/replay_buffer.py","file_url":"https://github.com/atavakol/action-branching-agents/blob/HEAD/agents/bdq/deepq/replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f6c715a36c9b0278","mcp_get_code":{"code_sha256":"f6c715a36c9b0278"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Arrabonae/openai_DDDQN","path":"replay.py","file_url":"https://github.com/Arrabonae/openai_DDDQN/blob/HEAD/replay.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"82024cb507cb1dee","mcp_get_code":{"code_sha256":"82024cb507cb1dee"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CharlotteMorrison/Baxter-VREP-Version-2","path":"td3/experience/priority_replay_buffer.py","file_url":"https://github.com/CharlotteMorrison/Baxter-VREP-Version-2/blob/HEAD/td3/experience/priority_replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a1b54613a3985829","mcp_get_code":{"code_sha256":"a1b54613a3985829"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MathPhysSim/PER-NAF","path":"pernaf/pernaf/utils/prioritised_experience_replay.py","file_url":"https://github.com/MathPhysSim/PER-NAF/blob/HEAD/pernaf/pernaf/utils/prioritised_experience_replay.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"46cf03e4d4b628c3","mcp_get_code":{"code_sha256":"46cf03e4d4b628c3"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SayhoKim/tetrisRL","path":"lib/utils/replay_buffer.py","file_url":"https://github.com/SayhoKim/tetrisRL/blob/HEAD/lib/utils/replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"867fd67d42cbe6f4","mcp_get_code":{"code_sha256":"867fd67d42cbe6f4"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"labmlai/annotated_deep_learning_paper_implementations","path":"labml_nn/rl/dqn/replay_buffer.py","file_url":"https://github.com/labmlai/annotated_deep_learning_paper_implementations/blob/HEAD/labml_nn/rl/dqn/replay_buffer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6e5e90f57a133b61","mcp_get_code":{"code_sha256":"6e5e90f57a133b61"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hill-a/stable-baselines","path":"stable_baselines/common/buffers.py","file_url":"https://github.com/hill-a/stable-baselines/blob/HEAD/stable_baselines/common/buffers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f5eb1be22a186f73","mcp_get_code":{"code_sha256":"f5eb1be22a186f73"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seacevedo/ReinforcementLearningProjects","path":"PER.py","file_url":"https://github.com/seacevedo/ReinforcementLearningProjects/blob/HEAD/PER.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4ec9642b187da0b4","mcp_get_code":{"code_sha256":"4ec9642b187da0b4"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Guillaume-Cr/lunar_lander_per","path":"replay_buffer.py","file_url":"https://github.com/Guillaume-Cr/lunar_lander_per/blob/HEAD/replay_buffer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f426229e0c5e2d70","mcp_get_code":{"code_sha256":"f426229e0c5e2d70"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nbopardi/smb","path":"dqn_utils.py","file_url":"https://github.com/nbopardi/smb/blob/HEAD/dqn_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1f3901918f090c5e","mcp_get_code":{"code_sha256":"1f3901918f090c5e"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Adrelf/DRL-navigation","path":"utils/memory.py","file_url":"https://github.com/Adrelf/DRL-navigation/blob/HEAD/utils/memory.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7859b3965dc78ae3","mcp_get_code":{"code_sha256":"7859b3965dc78ae3"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"philtabor/Deep-Q-Learning-Paper-To-Code","path":"DDQN/ddqn_agent.py","file_url":"https://github.com/philtabor/Deep-Q-Learning-Paper-To-Code/blob/HEAD/DDQN/ddqn_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2a2892343a3359ee","mcp_get_code":{"code_sha256":"2a2892343a3359ee"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MEOWMEOW114/nd893-p1-navigation-banana","path":"dqn/double_dqn_agent.py","file_url":"https://github.com/MEOWMEOW114/nd893-p1-navigation-banana/blob/HEAD/dqn/double_dqn_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dcd7958b0ad16526","mcp_get_code":{"code_sha256":"dcd7958b0ad16526"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DoubleDQN/DoubleDQN_Discrete.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DoubleDQN/DoubleDQN_Discrete.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"56d9058560cd0b68","mcp_get_code":{"code_sha256":"56d9058560cd0b68"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mohit8935/Deep-Q-Learning-Paper","path":"DDQN/ddqn_agent.py","file_url":"https://github.com/mohit8935/Deep-Q-Learning-Paper/blob/HEAD/DDQN/ddqn_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"41d448d208226341","mcp_get_code":{"code_sha256":"41d448d208226341"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Adrelf/DRL-navigation","path":"brain/dqn_agent.py","file_url":"https://github.com/Adrelf/DRL-navigation/blob/HEAD/brain/dqn_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0e225401249db6d9","mcp_get_code":{"code_sha256":"0e225401249db6d9"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1jsingh/rl_navigation","path":"agents/dqn_agent.py","file_url":"https://github.com/1jsingh/rl_navigation/blob/HEAD/agents/dqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f07ed06c9c4c4e7c","mcp_get_code":{"code_sha256":"f07ed06c9c4c4e7c"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fengsterooni/dql","path":"DDQN/ddqn_agent.py","file_url":"https://github.com/fengsterooni/dql/blob/HEAD/DDQN/ddqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"15af333b2f369749","mcp_get_code":{"code_sha256":"15af333b2f369749"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shehrum/RL_Navigation","path":"dqn_agent.py","file_url":"https://github.com/shehrum/RL_Navigation/blob/HEAD/dqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fd4b196396e41a0f","mcp_get_code":{"code_sha256":"fd4b196396e41a0f"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jeffery1236/Atari_DoubleDeepQNetwork","path":"DDQAgent.py","file_url":"https://github.com/jeffery1236/Atari_DoubleDeepQNetwork/blob/HEAD/DDQAgent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"28d5d41e56d53b63","mcp_get_code":{"code_sha256":"28d5d41e56d53b63"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yukezhu/tensorflow-reinforce","path":"rl/pg_ddpg.py","file_url":"https://github.com/yukezhu/tensorflow-reinforce/blob/HEAD/rl/pg_ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3c7178cf937ba425","mcp_get_code":{"code_sha256":"3c7178cf937ba425"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dpoulopoulos/drl_collaborate_compete","path":"ddpg_agent.py","file_url":"https://github.com/dpoulopoulos/drl_collaborate_compete/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1a3c5297309ff7b3","mcp_get_code":{"code_sha256":"1a3c5297309ff7b3"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"YoUNG824/DDPG","path":"ddpg.py","file_url":"https://github.com/YoUNG824/DDPG/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cbd6d4cba3c8f7b0","mcp_get_code":{"code_sha256":"cbd6d4cba3c8f7b0"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liampetti/DDPG","path":"ddpg.py","file_url":"https://github.com/liampetti/DDPG/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"532a74ad7f880104","mcp_get_code":{"code_sha256":"532a74ad7f880104"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient","path":"ddpg_agent.py","file_url":"https://github.com/iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6258582b31c25005","mcp_get_code":{"code_sha256":"6258582b31c25005"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"J93T/TP4-DDPG","path":"ddpg.py","file_url":"https://github.com/J93T/TP4-DDPG/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"79dfb108cab48c77","mcp_get_code":{"code_sha256":"79dfb108cab48c77"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dan-lennox/ml-udacity-quadcopter-rl","path":"agents/agent.py","file_url":"https://github.com/dan-lennox/ml-udacity-quadcopter-rl/blob/HEAD/agents/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"48908dfdd43f1c2f","mcp_get_code":{"code_sha256":"48908dfdd43f1c2f"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HJDQN/HJQ","path":"algorithms/ddpg/ddpg.py","file_url":"https://github.com/HJDQN/HJQ/blob/HEAD/algorithms/ddpg/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a15460ad3a6b391e","mcp_get_code":{"code_sha256":"a15460ad3a6b391e"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MathPhysSim/PER-NAF","path":"pernaf/pernaf/naf.py","file_url":"https://github.com/MathPhysSim/PER-NAF/blob/HEAD/pernaf/pernaf/naf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d8fadcf1cbc892d5","mcp_get_code":{"code_sha256":"d8fadcf1cbc892d5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dfki-ric-underactuated-lab/torque_limited_simple_pendulum","path":"software/python/simple_pendulum/reinforcement_learning/ddpg/ddpg.py","file_url":"https://github.com/dfki-ric-underactuated-lab/torque_limited_simple_pendulum/blob/HEAD/software/python/simple_pendulum/reinforcement_learning/ddpg/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"3869ba95ec3a2e1a","mcp_get_code":{"code_sha256":"3869ba95ec3a2e1a"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madhur-tandon/RL-Project","path":"agent.py","file_url":"https://github.com/madhur-tandon/RL-Project/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"87674610395558bb","mcp_get_code":{"code_sha256":"87674610395558bb"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"T3chy/DDPG","path":"ddpg_torch.py","file_url":"https://github.com/T3chy/DDPG/blob/HEAD/ddpg_torch.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"7ebcb237f3ac8b6b","mcp_get_code":{"code_sha256":"7ebcb237f3ac8b6b"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alathiya/RL-Quadcoptor-Flying","path":"agents/agent.py","file_url":"https://github.com/alathiya/RL-Quadcoptor-Flying/blob/HEAD/agents/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a1866c0223c9dca1","mcp_get_code":{"code_sha256":"a1866c0223c9dca1"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DDPG/DDPG_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DDPG/DDPG_Continuous.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"031efd28ccd13e08","mcp_get_code":{"code_sha256":"031efd28ccd13e08"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bmeyers/VirtualMicrogridSegmentation","path":"virtual_microgrids/algorithms/ddpg.py","file_url":"https://github.com/bmeyers/VirtualMicrogridSegmentation/blob/HEAD/virtual_microgrids/algorithms/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"well_formed","behaviour_fingerprint":true,"licence":"BSD-2-Clause","inline_ok":true,"code_sha256_prefix":"88607f875726a410","mcp_get_code":{"code_sha256":"88607f875726a410"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"denizmguen/IANNWTF2019-Project","path":"ddpg.py","file_url":"https://github.com/denizmguen/IANNWTF2019-Project/blob/HEAD/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"49ac8c4b2338f149","mcp_get_code":{"code_sha256":"49ac8c4b2338f149"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"samuelmat19/DDPG-tf2","path":"src/model.py","file_url":"https://github.com/samuelmat19/DDPG-tf2/blob/HEAD/src/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d2b4efe0274fc66","mcp_get_code":{"code_sha256":"0d2b4efe0274fc66"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Philori22/DDPG-aigym","path":"ddpg.py","file_url":"https://github.com/Philori22/DDPG-aigym/blob/HEAD/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1229a5d8dea62487","mcp_get_code":{"code_sha256":"1229a5d8dea62487"}}]}