{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/critic","entry":"Critic","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":60,"n_papers_ran":50,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":111,"n_samples_ran":87,"n_samples_fingerprinted":15,"n_places":111,"n_places_pointer_only":65,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":87,"unverified":24},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.17373","paper":"/paper/arxiv-2608-17373","title":"Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"UoA-CARES/NSPER","path":"nsper_td3.py","file_url":"https://github.com/UoA-CARES/NSPER/blob/HEAD/nsper_td3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"89034967784ec2cc","mcp_get_code":{"code_sha256":"89034967784ec2cc"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"MAOYIXIU/SVR","path":"SVR.py","file_url":"https://github.com/MAOYIXIU/SVR/blob/HEAD/SVR.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f3d57c097cbcf790","mcp_get_code":{"code_sha256":"f3d57c097cbcf790"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"familyld/SCORE","path":"score/SCORE.py","file_url":"https://github.com/familyld/SCORE/blob/HEAD/score/SCORE.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"678058ab16de3c25","mcp_get_code":{"code_sha256":"678058ab16de3c25"}},{"arxiv_id":"2605.16692","paper":"/paper/arxiv-2605-16692","title":"EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"naumix/BiggerRegularizedCategorical","path":"jaxrl/networks.py","file_url":"https://github.com/naumix/BiggerRegularizedCategorical/blob/HEAD/jaxrl/networks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8db705a2d4f2ef18","mcp_get_code":{"code_sha256":"8db705a2d4f2ef18"}},{"arxiv_id":"2605.01242","paper":"/paper/arxiv-2605-01242","title":"Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"shelowize/lvrep-rl","path":"agent/ctrlsac/ctrlsac_agent.py","file_url":"https://github.com/shelowize/lvrep-rl/blob/HEAD/agent/ctrlsac/ctrlsac_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"04fe51402591dbc5","mcp_get_code":{"code_sha256":"04fe51402591dbc5"}},{"arxiv_id":"2604.19146","paper":"/paper/arxiv-2604-19146","title":"RL-ABC: Reinforcement Learning for Accelerator Beamline Control","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Anwar9Ibrahim/RL-ABC","path":"rl_framework/Agents/DDPG.py","file_url":"https://github.com/Anwar9Ibrahim/RL-ABC/blob/HEAD/rl_framework/Agents/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5f0a44af9e3f1e52","mcp_get_code":{"code_sha256":"5f0a44af9e3f1e52"}},{"arxiv_id":"2604.18190","paper":"/paper/arxiv-2604-18190","title":"Scalable Neighborhood-Based Multi-Agent Actor-Critic","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"TimGop/MADDPG-K","path":"src/MADDPG_agent.py","file_url":"https://github.com/TimGop/MADDPG-K/blob/HEAD/src/MADDPG_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"63d03f5839af929a","mcp_get_code":{"code_sha256":"63d03f5839af929a"}},{"arxiv_id":"2603.17685","paper":"/paper/arxiv-2603-17685","title":"Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints","date":"2026-03-18","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"wadx2019/qvpo","path":"agent/qvpo.py","file_url":"https://github.com/wadx2019/qvpo/blob/HEAD/agent/qvpo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e3e7ea9dea530ccd","mcp_get_code":{"code_sha256":"e3e7ea9dea530ccd"}},{"arxiv_id":"2603.07020","paper":"/paper/arxiv-2603-07020","title":"RESCHED: Rethinking Flexible Job Shop Scheduling from a Transformer-based Architecture with Simplified States","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"XiangjieXiao/ReSched","path":"PPO/SchedulingModel.py","file_url":"https://github.com/XiangjieXiao/ReSched/blob/HEAD/PPO/SchedulingModel.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"42d2bbe83c775a20","mcp_get_code":{"code_sha256":"42d2bbe83c775a20"}},{"arxiv_id":"2603.05066","paper":"/paper/arxiv-2603-05066","title":"Reward-Conditioned Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"naumix/BiggerRegularizedCategorical","path":"jaxrl/agent/brc_learner.py","file_url":"https://github.com/naumix/BiggerRegularizedCategorical/blob/HEAD/jaxrl/agent/brc_learner.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5366a0d342198b2d","mcp_get_code":{"code_sha256":"5366a0d342198b2d"}},{"arxiv_id":"2505.16734","paper":"/paper/maximum-total-correlation-reinforcement","title":"Maximum Total Correlation Reinforcement Learning","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bangyou01/mtc","path":"tcsac.py","file_url":"https://github.com/bangyou01/mtc/blob/HEAD/tcsac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"763fe7eb647a4e12","mcp_get_code":{"code_sha256":"763fe7eb647a4e12"}},{"arxiv_id":"2501.16142","paper":"/paper/towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/TD7","path":"TD7.py","file_url":"https://github.com/sfujim/TD7/blob/HEAD/TD7.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"32addd2524f26a0b","mcp_get_code":{"code_sha256":"32addd2524f26a0b"}},{"arxiv_id":"2412.07167","paper":"/paper/reinforcement-learning-policy-as-macro","title":"Reinforcement Learning Policy as Macro Regulator Rather than Macro Placer","date":"2024-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lamda-bbo/macro-regulator","path":"src/agent.py","file_url":"https://github.com/lamda-bbo/macro-regulator/blob/HEAD/src/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"0acb8db9ab90a6f8","mcp_get_code":{"code_sha256":"0acb8db9ab90a6f8"}},{"arxiv_id":"2411.07934","paper":"/paper/doubly-mild-generalization-for-offline","title":"Doubly Mild Generalization for Offline Reinforcement Learning","date":"2024-11-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maoyixiu/dmg","path":"DMG.py","file_url":"https://github.com/maoyixiu/dmg/blob/HEAD/DMG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d041bf92f08ea21f","mcp_get_code":{"code_sha256":"d041bf92f08ea21f"}},{"arxiv_id":"2410.21795","paper":"/paper/robot-policy-learning-with-temporal-optimal","title":"Robot Policy Learning with Temporal Optimal Transport Reward","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fuyw/temporalot","path":"models/temporalot.py","file_url":"https://github.com/fuyw/temporalot/blob/HEAD/models/temporalot.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c9b4f709ae060bc1","mcp_get_code":{"code_sha256":"c9b4f709ae060bc1"}},{"arxiv_id":"2410.08979","paper":"/paper/overcoming-slow-decision-frequencies-in","title":"Overcoming Slow Decision Frequencies in Continuous Control: Model-Based Sequence Reinforcement Learning for Model-Free Control","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dee0512/Temporally-Layered-Architecture","path":"model.py","file_url":"https://github.com/dee0512/Temporally-Layered-Architecture/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"0a41250eec295ce6","mcp_get_code":{"code_sha256":"0a41250eec295ce6"}},{"arxiv_id":"2406.16255","paper":"/paper/uncertainty-aware-reward-free-exploration","title":"Uncertainty-Aware Reward-Free Exploration with General Function Approximation","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uclaml/gfa-rfe","path":"agent/dsquare.py","file_url":"https://github.com/uclaml/gfa-rfe/blob/HEAD/agent/dsquare.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"790cb19787a27e3c","mcp_get_code":{"code_sha256":"790cb19787a27e3c"}},{"arxiv_id":"2406.13909","paper":"/paper/beyond-optimism-exploration-with-partially","title":"Beyond Optimism: Exploration With Partially Observable Rewards","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AmiiThinks/mon_mdp_neurips24","path":"src/actor.py","file_url":"https://github.com/AmiiThinks/mon_mdp_neurips24/blob/HEAD/src/actor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"d01ee419e1d16cd5","mcp_get_code":{"code_sha256":"d01ee419e1d16cd5"}},{"arxiv_id":"2405.19909","paper":"/paper/adaptive-advantage-guided-policy","title":"Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ltlhuuu/a2pr","path":"A2PR.py","file_url":"https://github.com/ltlhuuu/a2pr/blob/HEAD/A2PR.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7daa282f895ac3b2","mcp_get_code":{"code_sha256":"7daa282f895ac3b2"}},{"arxiv_id":"2405.19690","paper":"/paper/diffusion-policies-creating-a-trust-region","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tianyucodings/diffusion_trusted_q_learning","path":"agents/dtql.py","file_url":"https://github.com/tianyucodings/diffusion_trusted_q_learning/blob/HEAD/agents/dtql.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"59d5a0d1c043921d","mcp_get_code":{"code_sha256":"59d5a0d1c043921d"}},{"arxiv_id":"2405.18792","paper":"/paper/kernel-metric-learning-for-in-sample-off","title":"Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies","date":"2024-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"haanvid/kmifqe","path":"KMIFQE.py","file_url":"https://github.com/haanvid/kmifqe/blob/HEAD/KMIFQE.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a858007a9d9624d1","mcp_get_code":{"code_sha256":"a858007a9d9624d1"}},{"arxiv_id":"2310.19668","paper":"/paper/drm-mastering-visual-reinforcement-learning","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XuGW-Kevin/DrM","path":"agents/drm.py","file_url":"https://github.com/XuGW-Kevin/DrM/blob/HEAD/agents/drm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a9ad8dd2711932a5","mcp_get_code":{"code_sha256":"a9ad8dd2711932a5"}},{"arxiv_id":"2310.17966","paper":"/paper/train-once-get-a-family-state-adaptive-1","title":"Train Once, Get a Family: State-Adaptive Balances for Offline-to-Online Reinforcement Learning","date":"2023-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leaplabthu/famo2o","path":"jax_iql/family_learner.py","file_url":"https://github.com/leaplabthu/famo2o/blob/HEAD/jax_iql/family_learner.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"099783f7940c8b90","mcp_get_code":{"code_sha256":"099783f7940c8b90"}},{"arxiv_id":"2310.07418","paper":"/paper/revisiting-plasticity-in-visual-reinforcement","title":"Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages","date":"2023-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Guozheng-Ma/Adaptive-Replay-Ratio","path":"drqv2_adapt_rr.py","file_url":"https://github.com/Guozheng-Ma/Adaptive-Replay-Ratio/blob/HEAD/drqv2_adapt_rr.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"36d9b0605e82c6be","mcp_get_code":{"code_sha256":"36d9b0605e82c6be"}},{"arxiv_id":"2310.05333","paper":"/paper/diffcps-diffusion-model-based-constrained","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"felix-thu/DiffCPS","path":"agents/diffcps.py","file_url":"https://github.com/felix-thu/DiffCPS/blob/HEAD/agents/diffcps.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5bdc9227d5668ad4","mcp_get_code":{"code_sha256":"5bdc9227d5668ad4"}},{"arxiv_id":"2307.08875","paper":"/paper/natural-actor-critic-for-robust-reinforcement","title":"Natural Actor-Critic for Robust Reinforcement Learning with Function Approximation","date":"2023-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tliu1997/rnac","path":"train_rnac.py","file_url":"https://github.com/tliu1997/rnac/blob/HEAD/train_rnac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"40af160a65b521e5","mcp_get_code":{"code_sha256":"40af160a65b521e5"}},{"arxiv_id":"2306.06569","paper":"/paper/policy-regularization-with-dataset-constraint","title":"Policy Regularization with Dataset Constraint for Offline Reinforcement Learning","date":"2023-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lamda-rl/prdc","path":"prdc.py","file_url":"https://github.com/lamda-rl/prdc/blob/HEAD/prdc.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d2ea31a27fb25f0e","mcp_get_code":{"code_sha256":"d2ea31a27fb25f0e"}},{"arxiv_id":"2305.15249","paper":"/paper/decision-aware-actor-critic-with-function-1","title":"Decision-Aware Actor-Critic with Function Approximation and Theoretical Guarantees","date":"2023-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"amirrezakazemi/acpg","path":"Critic.py","file_url":"https://github.com/amirrezakazemi/acpg/blob/HEAD/Critic.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"488940cfd9ea3dd6","mcp_get_code":{"code_sha256":"488940cfd9ea3dd6"}},{"arxiv_id":"2305.12239","paper":"/paper/off-policy-average-reward-actor-critic-with","title":"Off-Policy Average Reward Actor-Critic with Deterministic Policy Search","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"namansaxena9/ARO-DDPG","path":"cheetah_run/ddpg_model.py","file_url":"https://github.com/namansaxena9/ARO-DDPG/blob/HEAD/cheetah_run/ddpg_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e114b8f10c6d0466","mcp_get_code":{"code_sha256":"e114b8f10c6d0466"}},{"arxiv_id":"2303.08447","paper":"/paper/mahtm-a-multi-agent-framework-for","title":"MAHTM: A Multi-Agent Framework for Hierarchical Transactive Microgrids","date":"2023-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicosquare/rl-energy-management","path":"src/algos/rl/coma/d_simple_microgrid.py","file_url":"https://github.com/nicosquare/rl-energy-management/blob/HEAD/src/algos/rl/coma/d_simple_microgrid.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c08e3973d4803876","mcp_get_code":{"code_sha256":"c08e3973d4803876"}},{"arxiv_id":"2211.00164","paper":"/paper/agent-controller-representations-principled","title":"Agent-Controller Representations: Principled Offline RL with Rich Exogenous Information","date":"2022-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"manantomar/agent-centric-representations","path":"acro.py","file_url":"https://github.com/manantomar/agent-centric-representations/blob/HEAD/acro.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dd6b646ab722fba0","mcp_get_code":{"code_sha256":"dd6b646ab722fba0"}},{"arxiv_id":"2210.10765","paper":"/paper/when-to-ask-for-help-proactive-interventions","title":"When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning","date":"2022-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tajwarfahim/proactive_interventions","path":"paint/agents.py","file_url":"https://github.com/tajwarfahim/proactive_interventions/blob/HEAD/paint/agents.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"27be937323954f60","mcp_get_code":{"code_sha256":"27be937323954f60"}},{"arxiv_id":"2209.08646","paper":"/paper/deeptop-deep-threshold-optimal-policy-for","title":"DeepTOP: Deep Threshold-Optimal Policy for MDPs and RMABs","date":"2022-09-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"khalednakhleh/deeptop","path":"MDP/DeepTOP.py","file_url":"https://github.com/khalednakhleh/deeptop/blob/HEAD/MDP/DeepTOP.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"61ba3ab4aa8be9c0","mcp_get_code":{"code_sha256":"61ba3ab4aa8be9c0"}},{"arxiv_id":"2208.05129","paper":"/paper/robust-reinforcement-learning-using-offline","title":"Robust Reinforcement Learning using Offline Data","date":"2022-08-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zaiyan-x/RFQI","path":"rfqi.py","file_url":"https://github.com/zaiyan-x/RFQI/blob/HEAD/rfqi.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5e377d73ec00233f","mcp_get_code":{"code_sha256":"5e377d73ec00233f"}},{"arxiv_id":"2205.00943","paper":"/paper/cclf-a-contrastive-curiosity-driven-learning","title":"CCLF: A Contrastive-Curiosity-Driven Learning Framework for Sample-Efficient Reinforcement Learning","date":"2022-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csun001/CCLF","path":"CCLF_sac.py","file_url":"https://github.com/csun001/CCLF/blob/HEAD/CCLF_sac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c82d48f108411cb2","mcp_get_code":{"code_sha256":"c82d48f108411cb2"}},{"arxiv_id":"2203.14936","paper":"/paper/fedvln-privacy-preserving-federated-vision","title":"FedVLN: Privacy-preserving Federated Vision-and-Language Navigation","date":"2022-03-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eric-ai-lab/FedVLN","path":"r2r_src/agent.py","file_url":"https://github.com/eric-ai-lab/FedVLN/blob/HEAD/r2r_src/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2187ea87b0f4c35c","mcp_get_code":{"code_sha256":"2187ea87b0f4c35c"}},{"arxiv_id":"2203.08553","paper":"/paper/pmic-improving-multi-agent-reinforcement-1","title":"PMIC: Improving Multi-Agent Reinforcement Learning with Progressive Mutual Information Collaboration","date":"2022-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yeshenpy/pmic","path":"algorithms/mpe_new_maxminMADDPG.py","file_url":"https://github.com/yeshenpy/pmic/blob/HEAD/algorithms/mpe_new_maxminMADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0b5742fd1596a2a9","mcp_get_code":{"code_sha256":"0b5742fd1596a2a9"}},{"arxiv_id":"2202.10324","paper":"/paper/vrl3-a-data-driven-framework-for-visual-deep","title":"VRL3: A Data-Driven Framework for Visual Deep Reinforcement Learning","date":"2022-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/drqv2","path":"drqv2.py","file_url":"https://github.com/facebookresearch/drqv2/blob/HEAD/drqv2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e1f8d4dffda3351e","mcp_get_code":{"code_sha256":"e1f8d4dffda3351e"}},{"arxiv_id":"2202.05244","paper":"/paper/revolver-continuous-evolutionary-models-for","title":"REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer","date":"2022-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xingyul/revolver","path":"gym/SAC.py","file_url":"https://github.com/xingyul/revolver/blob/HEAD/gym/SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"GPL-2.0","inline_ok":false,"code_sha256_prefix":"91da284c9c4645ee","mcp_get_code":{"code_sha256":"91da284c9c4645ee"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"orrivlin/implicit-q-learning","path":"IQL.py","file_url":"https://github.com/orrivlin/implicit-q-learning/blob/HEAD/IQL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"80a6ad9eabb2130a","mcp_get_code":{"code_sha256":"80a6ad9eabb2130a"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Manchery/iql-pytorch","path":"IQL.py","file_url":"https://github.com/Manchery/iql-pytorch/blob/HEAD/IQL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"babedc4feb0bd1bc","mcp_get_code":{"code_sha256":"babedc4feb0bd1bc"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Implicit-Q-Learning","path":"agent.py","file_url":"https://github.com/BY571/Implicit-Q-Learning/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1a4179d29d5698c1","mcp_get_code":{"code_sha256":"1a4179d29d5698c1"}},{"arxiv_id":"2110.01548","paper":"/paper/uncertainty-based-offline-reinforcement","title":"Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble","date":"2021-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"howuhh/sac-n-jax","path":"sac_n_jax_flax.py","file_url":"https://github.com/howuhh/sac-n-jax/blob/HEAD/sac_n_jax_flax.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5794e64ed17e773b","mcp_get_code":{"code_sha256":"5794e64ed17e773b"}},{"arxiv_id":"2110.01528","paper":"/paper/large-batch-experience-replay","title":"Large Batch Experience Replay","date":"2021-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sureli/laber","path":"LaBER/continuous/LABER_SAC.py","file_url":"https://github.com/sureli/laber/blob/HEAD/LaBER/continuous/LABER_SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4949a32e6cb9c3c5","mcp_get_code":{"code_sha256":"4949a32e6cb9c3c5"}},{"arxiv_id":"2107.12216","paper":"/paper/hindsight-value-function-for-variance","title":"Hindsight Value Function for Variance Reduction in Stochastic Dynamic Environment","date":"2021-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guojm14/HVF","path":"reduce_var/mlp.py","file_url":"https://github.com/guojm14/HVF/blob/HEAD/reduce_var/mlp.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"05a92190f86414b3","mcp_get_code":{"code_sha256":"05a92190f86414b3"}},{"arxiv_id":"2101.05982","paper":"/paper/randomized-ensembled-double-q-learning-1","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","date":"2021-01-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Randomized-Ensembled-Double-Q-learning-REDQ-","path":"agent.py","file_url":"https://github.com/BY571/Randomized-Ensembled-Double-Q-learning-REDQ-/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8e666530dcfbca00","mcp_get_code":{"code_sha256":"8e666530dcfbca00"}},{"arxiv_id":"2010.09177","paper":"/paper/softmax-deep-double-deterministic-policy","title":"Softmax Deep Double Deterministic Policy Gradients","date":"2020-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ling-pan/SD3","path":"SD3.py","file_url":"https://github.com/ling-pan/SD3/blob/HEAD/SD3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"477fb90847703c61","mcp_get_code":{"code_sha256":"477fb90847703c61"}},{"arxiv_id":"2007.04309","paper":"/paper/self-supervised-policy-adaptation-during","title":"Self-Supervised Policy Adaptation during Deployment","date":"2020-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicklashansen/policy-adaptation-during-deployment","path":"src/agent/agent.py","file_url":"https://github.com/nicklashansen/policy-adaptation-during-deployment/blob/HEAD/src/agent/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e70accfa4161d131","mcp_get_code":{"code_sha256":"e70accfa4161d131"}},{"arxiv_id":"2006.11485","paper":"/paper/generating-adjacency-constrained-subgoals-in","title":"Generating Adjacency-Constrained Subgoals in Hierarchical Reinforcement Learning","date":"2020-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"trzhang0116/HRAC","path":"hrac/hrac.py","file_url":"https://github.com/trzhang0116/HRAC/blob/HEAD/hrac/hrac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"21f95f4c74fe408f","mcp_get_code":{"code_sha256":"21f95f4c74fe408f"}},{"arxiv_id":"2006.04779","paper":"/paper/conservative-q-learning-for-offline","title":"Conservative Q-Learning for Offline Reinforcement Learning","date":"2020-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/CQL","path":"CQL-SAC/agent.py","file_url":"https://github.com/BY571/CQL/blob/HEAD/CQL-SAC/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"00012db4f3753643","mcp_get_code":{"code_sha256":"00012db4f3753643"}},{"arxiv_id":"2004.14990","paper":"/paper/reinforcement-learning-with-augmented-data","title":"Reinforcement Learning with Augmented Data","date":"2020-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MishaLaskin/rad","path":"curl_sac.py","file_url":"https://github.com/MishaLaskin/rad/blob/HEAD/curl_sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"faa8d44dfeaada9d","mcp_get_code":{"code_sha256":"faa8d44dfeaada9d"}},{"arxiv_id":"2004.13649","paper":"/paper/image-augmentation-is-all-you-need","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","date":"2020-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xingyu-lin/softagent","path":"drq/Drq.py","file_url":"https://github.com/xingyu-lin/softagent/blob/HEAD/drq/Drq.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8f4711abca857d4a","mcp_get_code":{"code_sha256":"8f4711abca857d4a"}},{"arxiv_id":"2003.05334","paper":"/paper/online-meta-critic-learning-for-off-policy-1","title":"Online Meta-Critic Learning for Off-Policy Actor-Critic Methods","date":"2020-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zwfightzw/Meta-Critic","path":"TD3_DDPG_MC/DDPG_MC.py","file_url":"https://github.com/zwfightzw/Meta-Critic/blob/HEAD/TD3_DDPG_MC/DDPG_MC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dec65f597098b86c","mcp_get_code":{"code_sha256":"dec65f597098b86c"}},{"arxiv_id":"2002.09505","paper":"/paper/estimating-qss-with-deep-deterministic","title":"Estimating Q(s,s') with Deep Deterministic Dynamics Gradients","date":"2020-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uber-research/D3G","path":"D3G/D3G.py","file_url":"https://github.com/uber-research/D3G/blob/HEAD/D3G/D3G.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5768f7ee30d492be","mcp_get_code":{"code_sha256":"5768f7ee30d492be"}},{"arxiv_id":"2002.09505","paper":"/paper/estimating-qss-with-deep-deterministic","title":"Estimating Q(s,s') with Deep Deterministic Dynamics Gradients","date":"2020-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/TD3","path":"TD3.py","file_url":"https://github.com/sfujim/TD3/blob/HEAD/TD3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"917266e440b9fbc2","mcp_get_code":{"code_sha256":"917266e440b9fbc2"}},{"arxiv_id":"2002.00632","paper":"/paper/effective-diversity-in-population-based","title":"Effective Diversity in Population Based Reinforcement Learning","date":"2020-02-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"holounic/DvD-TD3","path":"td3/algorithm.py","file_url":"https://github.com/holounic/DvD-TD3/blob/HEAD/td3/algorithm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b97e9e0f24a99b33","mcp_get_code":{"code_sha256":"b97e9e0f24a99b33"}},{"arxiv_id":"1812.02900","paper":"/paper/off-policy-deep-reinforcement-learning","title":"Off-Policy Deep Reinforcement Learning without Exploration","date":"2018-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"theSparta/off_policy_mujoco","path":"RSEM.py","file_url":"https://github.com/theSparta/off_policy_mujoco/blob/HEAD/RSEM.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5bd57f3d9b802889","mcp_get_code":{"code_sha256":"5bd57f3d9b802889"}},{"arxiv_id":"1812.02900","paper":"/paper/off-policy-deep-reinforcement-learning","title":"Off-Policy Deep Reinforcement Learning without Exploration","date":"2018-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maziarg/PrivAttack-BCQ","path":"continuous_BCQ/BCQ.py","file_url":"https://github.com/maziarg/PrivAttack-BCQ/blob/HEAD/continuous_BCQ/BCQ.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"48b14528ccc28930","mcp_get_code":{"code_sha256":"48b14528ccc28930"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning","path":"src/agents.py","file_url":"https://github.com/MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning/blob/HEAD/src/agents.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7c4433b21cf61a2c","mcp_get_code":{"code_sha256":"7c4433b21cf61a2c"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baturaysaglam/la3p","path":"Code/SAC/SAC.py","file_url":"https://github.com/baturaysaglam/la3p/blob/HEAD/Code/SAC/SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f8ead4c2c205ecd8","mcp_get_code":{"code_sha256":"f8ead4c2c205ecd8"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Soft-Actor-Critic-and-Extensions","path":"files/Agent.py","file_url":"https://github.com/BY571/Soft-Actor-Critic-and-Extensions/blob/HEAD/files/Agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8f0377d2cad944f3","mcp_get_code":{"code_sha256":"8f0377d2cad944f3"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SaminYeasar/off_policy_ac","path":"SAC/SAC.py","file_url":"https://github.com/SaminYeasar/off_policy_ac/blob/HEAD/SAC/SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a0a4c6c892e497cd","mcp_get_code":{"code_sha256":"a0a4c6c892e497cd"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/PPO-Reacher_UnityML","path":"agent.py","file_url":"https://github.com/bonniesjli/PPO-Reacher_UnityML/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b4455ab1f545ae9c","mcp_get_code":{"code_sha256":"b4455ab1f545ae9c"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Gregory-Eales/proximal-policy-optimization","path":"ppo/modules/ppo.py","file_url":"https://github.com/Gregory-Eales/proximal-policy-optimization/blob/HEAD/ppo/modules/ppo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f1685211d6effd06","mcp_get_code":{"code_sha256":"f1685211d6effd06"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"PPO/PPO_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/PPO/PPO_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c004c93ba5634851","mcp_get_code":{"code_sha256":"c004c93ba5634851"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"PPO.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/PPO.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"708e869097ea91ff","mcp_get_code":{"code_sha256":"708e869097ea91ff"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yoavalon/Quadcopter-env","path":"kdev/ppo.py","file_url":"https://github.com/yoavalon/Quadcopter-env/blob/HEAD/kdev/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"f42b9cecada07086","mcp_get_code":{"code_sha256":"f42b9cecada07086"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zowiezhang/stas","path":"models/policy/COMA.py","file_url":"https://github.com/zowiezhang/stas/blob/HEAD/models/policy/COMA.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6879c98b93ce7112","mcp_get_code":{"code_sha256":"6879c98b93ce7112"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rainandwind1/MADDPG-reconstruct","path":"MADDPG/model.py","file_url":"https://github.com/rainandwind1/MADDPG-reconstruct/blob/HEAD/MADDPG/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"30449e98cba1cf61","mcp_get_code":{"code_sha256":"30449e98cba1cf61"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrDaubinet/collaboration-and-competition","path":"maddpg.py","file_url":"https://github.com/MrDaubinet/collaboration-and-competition/blob/HEAD/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6c1f59af0972c70e","mcp_get_code":{"code_sha256":"6c1f59af0972c70e"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"starry-sky6688/MADDPG","path":"maddpg/maddpg.py","file_url":"https://github.com/starry-sky6688/MADDPG/blob/HEAD/maddpg/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"601cec5195b4709d","mcp_get_code":{"code_sha256":"601cec5195b4709d"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"krasing/DRLearningCollaboration","path":"failed_collaborative/ddpg_agent_multi_2.py","file_url":"https://github.com/krasing/DRLearningCollaboration/blob/HEAD/failed_collaborative/ddpg_agent_multi_2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9af882c88cb87dda","mcp_get_code":{"code_sha256":"9af882c88cb87dda"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity","path":"multiagent_resources.py","file_url":"https://github.com/petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity/blob/HEAD/multiagent_resources.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6d943b1d04649de3","mcp_get_code":{"code_sha256":"6d943b1d04649de3"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"isp1tze/MAProj","path":"algo/maddpg/maddpg_agent.py","file_url":"https://github.com/isp1tze/MAProj/blob/HEAD/algo/maddpg/maddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0d8d2fce5fa8c834","mcp_get_code":{"code_sha256":"0d8d2fce5fa8c834"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xuehy/pytorch-maddpg","path":"MADDPG.py","file_url":"https://github.com/xuehy/pytorch-maddpg/blob/HEAD/MADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a7f0fe3c4dffccc9","mcp_get_code":{"code_sha256":"a7f0fe3c4dffccc9"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/MADDPG_Tennis_UnityML","path":"MADDPG.py","file_url":"https://github.com/bonniesjli/MADDPG_Tennis_UnityML/blob/HEAD/MADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b89abb00e73f1560","mcp_get_code":{"code_sha256":"b89abb00e73f1560"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anonymous-iclr22/trust-region-in-multi-agent-reinforcement-learning","path":"algorithms/happo_policy.py","file_url":"https://github.com/anonymous-iclr22/trust-region-in-multi-agent-reinforcement-learning/blob/HEAD/algorithms/happo_policy.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"598a59b21df91031","mcp_get_code":{"code_sha256":"598a59b21df91031"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"johannesharmse/multi_agent_RL","path":"ddpg.py","file_url":"https://github.com/johannesharmse/multi_agent_RL/blob/HEAD/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e9875c7422df7fec","mcp_get_code":{"code_sha256":"e9875c7422df7fec"}},{"arxiv_id":"1704.00028","paper":"/paper/improved-training-of-wasserstein-gans","title":"Improved Training of Wasserstein GANs","date":"2017-03-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dylanell/conditional-wgan","path":"conditional_gan/modules.py","file_url":"https://github.com/dylanell/conditional-wgan/blob/HEAD/conditional_gan/modules.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0faeeae133c3fe8e","mcp_get_code":{"code_sha256":"0faeeae133c3fe8e"}},{"arxiv_id":"1703.03400","paper":"/paper/model-agnostic-meta-learning-for-fast","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","date":"2017-03-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dkalpakchi/ReproducingSCAPytorch","path":"few_shot_learning_system.py","file_url":"https://github.com/dkalpakchi/ReproducingSCAPytorch/blob/HEAD/few_shot_learning_system.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5011b08348e5492e","mcp_get_code":{"code_sha256":"5011b08348e5492e"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"A2C.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/A2C.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3236a57bf19a97f5","mcp_get_code":{"code_sha256":"3236a57bf19a97f5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fshamshirdar/pytorch-rdpg","path":"rdpg.py","file_url":"https://github.com/fshamshirdar/pytorch-rdpg/blob/HEAD/rdpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"060c46e5cc508cc5","mcp_get_code":{"code_sha256":"060c46e5cc508cc5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dpoulopoulos/drl_collaborate_compete","path":"ddpg_agent.py","file_url":"https://github.com/dpoulopoulos/drl_collaborate_compete/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4210d97aa24222d8","mcp_get_code":{"code_sha256":"4210d97aa24222d8"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ghliu/pytorch-ddpg","path":"ddpg.py","file_url":"https://github.com/ghliu/pytorch-ddpg/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f93619eb32cfaf3d","mcp_get_code":{"code_sha256":"f93619eb32cfaf3d"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient","path":"ddpg_agent.py","file_url":"https://github.com/iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b6d3efae859b7b5b","mcp_get_code":{"code_sha256":"b6d3efae859b7b5b"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"VasaKiDD/TD3-deep-rl-research","path":"agent/DDPG.py","file_url":"https://github.com/VasaKiDD/TD3-deep-rl-research/blob/HEAD/agent/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"db5f4c6c0d3a50b4","mcp_get_code":{"code_sha256":"db5f4c6c0d3a50b4"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"J93T/TP4-DDPG","path":"ddpg.py","file_url":"https://github.com/J93T/TP4-DDPG/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5029b7b1380f0988","mcp_get_code":{"code_sha256":"5029b7b1380f0988"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HJDQN/HJQ","path":"algorithms/ddpg/ddpg.py","file_url":"https://github.com/HJDQN/HJQ/blob/HEAD/algorithms/ddpg/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a51e802f97dc5850","mcp_get_code":{"code_sha256":"a51e802f97dc5850"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env","path":"ddpg_agent.py","file_url":"https://github.com/IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"7a433b7591cb1ad7","mcp_get_code":{"code_sha256":"7a433b7591cb1ad7"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baturaysaglam/ac-off-poc","path":"DDPG & TD3/AC_Off_POC_DDPG.py","file_url":"https://github.com/baturaysaglam/ac-off-poc/blob/HEAD/DDPG%20%26%20TD3/AC_Off_POC_DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f2987dfa659c5d53","mcp_get_code":{"code_sha256":"f2987dfa659c5d53"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"b06b01073/continuous-control","path":"ddpg.py","file_url":"https://github.com/b06b01073/continuous-control/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ba54cbfa6390641d","mcp_get_code":{"code_sha256":"ba54cbfa6390641d"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZainRaza14/deepRL","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/ZainRaza14/deepRL/blob/HEAD/DDPG/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2cee98e5475e680a","mcp_get_code":{"code_sha256":"2cee98e5475e680a"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madhur-tandon/RL-Project","path":"agent.py","file_url":"https://github.com/madhur-tandon/RL-Project/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6e1fded857f54d7a","mcp_get_code":{"code_sha256":"6e1fded857f54d7a"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"biemann/Continuous-Control","path":"ddpg_agent.py","file_url":"https://github.com/biemann/Continuous-Control/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b78a712913941f90","mcp_get_code":{"code_sha256":"b78a712913941f90"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baturaysaglam/RIS-MISO-Deep-Reinforcement-Learning","path":"DDPG.py","file_url":"https://github.com/baturaysaglam/RIS-MISO-Deep-Reinforcement-Learning/blob/HEAD/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"65567268c56c2f46","mcp_get_code":{"code_sha256":"65567268c56c2f46"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Souphis/mobile_robot_rl","path":"mobile_robot_rl/agents/sac.py","file_url":"https://github.com/Souphis/mobile_robot_rl/blob/HEAD/mobile_robot_rl/agents/sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"40513685bd8b8200","mcp_get_code":{"code_sha256":"40513685bd8b8200"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hemilpanchiwala/Hindsight-Experience-Replay","path":"ddpg_with_her/DDPGAgent.py","file_url":"https://github.com/hemilpanchiwala/Hindsight-Experience-Replay/blob/HEAD/ddpg_with_her/DDPGAgent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"55f075a92d493d35","mcp_get_code":{"code_sha256":"55f075a92d493d35"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guillaumeboniface/reacher","path":"ddpg_controller.py","file_url":"https://github.com/guillaumeboniface/reacher/blob/HEAD/ddpg_controller.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e48c1f362301c6a8","mcp_get_code":{"code_sha256":"e48c1f362301c6a8"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"claudeHifly/BipedalWalker-v3","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/claudeHifly/BipedalWalker-v3/blob/HEAD/DDPG/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6e0920a743c03903","mcp_get_code":{"code_sha256":"6e0920a743c03903"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZiyangY/IndProject-RL-in-Supply-chain","path":"DDPG-based RNN/DDPG.py","file_url":"https://github.com/ZiyangY/IndProject-RL-in-Supply-chain/blob/HEAD/DDPG-based%20RNN/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"111a712bc883469d","mcp_get_code":{"code_sha256":"111a712bc883469d"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Philori22/DDPG-aigym","path":"ddpg.py","file_url":"https://github.com/Philori22/DDPG-aigym/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4c5d9db3e7d648c9","mcp_get_code":{"code_sha256":"4c5d9db3e7d648c9"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SaminYeasar/off_policy_ac","path":"DDPG/DDPG.py","file_url":"https://github.com/SaminYeasar/off_policy_ac/blob/HEAD/DDPG/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"daeec7442740e76e","mcp_get_code":{"code_sha256":"daeec7442740e76e"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dan-lennox/ml-udacity-quadcopter-rl","path":"agents/agent.py","file_url":"https://github.com/dan-lennox/ml-udacity-quadcopter-rl/blob/HEAD/agents/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"42b59cfab688e3f5","mcp_get_code":{"code_sha256":"42b59cfab688e3f5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"halajadallah/RL-Quadcopter_project","path":"agents/agent_modified.py","file_url":"https://github.com/halajadallah/RL-Quadcopter_project/blob/HEAD/agents/agent_modified.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c5b393b179d8d497","mcp_get_code":{"code_sha256":"c5b393b179d8d497"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"DDPG.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/DDPG.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a36fc940a0f3eb1b","mcp_get_code":{"code_sha256":"a36fc940a0f3eb1b"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madvn/DDPG","path":"ddpg/ddpg.py","file_url":"https://github.com/madvn/DDPG/blob/HEAD/ddpg/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d5cb870eb8408c73","mcp_get_code":{"code_sha256":"d5cb870eb8408c73"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shahabi8/Deep-Reinforcement-Learning","path":"DDGP.py","file_url":"https://github.com/shahabi8/Deep-Reinforcement-Learning/blob/HEAD/DDGP.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0872133cc6e7eee2","mcp_get_code":{"code_sha256":"0872133cc6e7eee2"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alathiya/RL-Quadcoptor-Flying","path":"agents/agent.py","file_url":"https://github.com/alathiya/RL-Quadcoptor-Flying/blob/HEAD/agents/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cf0cfca323e5c3c4","mcp_get_code":{"code_sha256":"cf0cfca323e5c3c4"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dyth/doublegum","path":"policies_cont/agents/DDPG.py","file_url":"https://github.com/dyth/doublegum/blob/HEAD/policies_cont/agents/DDPG.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"6040d49d762613d7","mcp_get_code":{"code_sha256":"6040d49d762613d7"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DDPG/DDPG_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DDPG/DDPG_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7f050e7ce4583465","mcp_get_code":{"code_sha256":"7f050e7ce4583465"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abbadka/quadcopter","path":"agents/ddpg/agent.py","file_url":"https://github.com/abbadka/quadcopter/blob/HEAD/agents/ddpg/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4080c577fc710255","mcp_get_code":{"code_sha256":"4080c577fc710255"}}]}