{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/actor","entry":"Actor","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":68,"n_papers_ran":53,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":126,"n_samples_ran":92,"n_samples_fingerprinted":57,"n_places":126,"n_places_pointer_only":75,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":92,"unverified":34},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.17373","paper":"/paper/arxiv-2608-17373","title":"Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"UoA-CARES/NSPER","path":"nsper_td3.py","file_url":"https://github.com/UoA-CARES/NSPER/blob/HEAD/nsper_td3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"38a6c669a5af885c","mcp_get_code":{"code_sha256":"38a6c669a5af885c"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"familyld/SCORE","path":"score/SCORE.py","file_url":"https://github.com/familyld/SCORE/blob/HEAD/score/SCORE.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e2c86f02b964230e","mcp_get_code":{"code_sha256":"e2c86f02b964230e"}},{"arxiv_id":"2608.01205","paper":"/paper/arxiv-2608-01205","title":"ReBRAC-v2: The Return of the King","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"Simple-Robotics/guided-flow-policy","path":"agents/rebrac.py","file_url":"https://github.com/Simple-Robotics/guided-flow-policy/blob/HEAD/agents/rebrac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"af17450f0bb38797","mcp_get_code":{"code_sha256":"af17450f0bb38797"}},{"arxiv_id":"2608.01205","paper":"/paper/arxiv-2608-01205","title":"ReBRAC-v2: The Return of the King","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"JongseongChae/FAC","path":"agents/rebrac.py","file_url":"https://github.com/JongseongChae/FAC/blob/HEAD/agents/rebrac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0df80f5dd0c1a3a9","mcp_get_code":{"code_sha256":"0df80f5dd0c1a3a9"}},{"arxiv_id":"2606.10228","paper":"/paper/arxiv-2606-10228","title":"SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"montrealrobotics/shapo","path":"safepo/single_agent/shapo.py","file_url":"https://github.com/montrealrobotics/shapo/blob/HEAD/safepo/single_agent/shapo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e8e31987c5d58926","mcp_get_code":{"code_sha256":"e8e31987c5d58926"}},{"arxiv_id":"2604.19146","paper":"/paper/arxiv-2604-19146","title":"RL-ABC: Reinforcement Learning for Accelerator Beamline Control","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"Anwar9Ibrahim/RL-ABC","path":"rl_framework/Agents/DDPG.py","file_url":"https://github.com/Anwar9Ibrahim/RL-ABC/blob/HEAD/rl_framework/Agents/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d3e22fc2c8926db9","mcp_get_code":{"code_sha256":"d3e22fc2c8926db9"}},{"arxiv_id":"2604.18190","paper":"/paper/arxiv-2604-18190","title":"Scalable Neighborhood-Based Multi-Agent Actor-Critic","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"TimGop/MADDPG-K","path":"src/MADDPG_agent.py","file_url":"https://github.com/TimGop/MADDPG-K/blob/HEAD/src/MADDPG_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"af9fbaf52f3cd1cb","mcp_get_code":{"code_sha256":"af9fbaf52f3cd1cb"}},{"arxiv_id":"2603.17685","paper":"/paper/arxiv-2603-17685","title":"Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints","date":"2026-03-18","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"Elessar123/SAC-FLOW","path":"from_scratch_code/SAC_flow_gru_jax.py","file_url":"https://github.com/Elessar123/SAC-FLOW/blob/HEAD/from_scratch_code/SAC_flow_gru_jax.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cbe4b2a64b8a77d3","mcp_get_code":{"code_sha256":"cbe4b2a64b8a77d3"}},{"arxiv_id":"2603.07020","paper":"/paper/arxiv-2603-07020","title":"RESCHED: Rethinking Flexible Job Shop Scheduling from a Transformer-based Architecture with Simplified States","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"XiangjieXiao/ReSched","path":"PPO/SchedulingModel.py","file_url":"https://github.com/XiangjieXiao/ReSched/blob/HEAD/PPO/SchedulingModel.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c43444a37a5a6755","mcp_get_code":{"code_sha256":"c43444a37a5a6755"}},{"arxiv_id":"2507.00485","paper":null,"title":"arXiv:2507.00485","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"azure-123/PNAct","path":"safepo/common/model.py","file_url":"https://github.com/azure-123/PNAct/blob/HEAD/safepo/common/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"832a4c764134d431","mcp_get_code":{"code_sha256":"832a4c764134d431"}},{"arxiv_id":"2506.12622","paper":"/paper/dr-sac-distributionally-robust-soft-actor","title":"DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty","date":"2025-06-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lemutisme/dr-sac","path":"sac.py","file_url":"https://github.com/lemutisme/dr-sac/blob/HEAD/sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b3d3944663449c1a","mcp_get_code":{"code_sha256":"b3d3944663449c1a"}},{"arxiv_id":"2506.08902","paper":"/paper/intention-conditioned-flow-occupancy-models","title":"Intention-Conditioned Flow Occupancy Models","date":"2025-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chongyi-zheng/infom","path":"agents/infom.py","file_url":"https://github.com/chongyi-zheng/infom/blob/HEAD/agents/infom.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"17f5041025f7c2b2","mcp_get_code":{"code_sha256":"17f5041025f7c2b2"}},{"arxiv_id":"2505.16734","paper":"/paper/maximum-total-correlation-reinforcement","title":"Maximum Total Correlation Reinforcement Learning","date":"2025-05-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bangyou01/mtc","path":"tcsac.py","file_url":"https://github.com/bangyou01/mtc/blob/HEAD/tcsac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8f578d66fd15da10","mcp_get_code":{"code_sha256":"8f578d66fd15da10"}},{"arxiv_id":"2504.11054","paper":"/paper/zero-shot-whole-body-humanoid-control-via","title":"Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models","date":"2025-04-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/metamotivo","path":"metamotivo/fb/model.py","file_url":"https://github.com/facebookresearch/metamotivo/blob/HEAD/metamotivo/fb/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"92468117ea8270ba","mcp_get_code":{"code_sha256":"92468117ea8270ba"}},{"arxiv_id":"2501.16142","paper":"/paper/towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/TD7","path":"TD7.py","file_url":"https://github.com/sfujim/TD7/blob/HEAD/TD7.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e41e9160d3bfd93f","mcp_get_code":{"code_sha256":"e41e9160d3bfd93f"}},{"arxiv_id":"2412.07167","paper":"/paper/reinforcement-learning-policy-as-macro","title":"Reinforcement Learning Policy as Macro Regulator Rather than Macro Placer","date":"2024-12-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lamda-bbo/macro-regulator","path":"src/agent.py","file_url":"https://github.com/lamda-bbo/macro-regulator/blob/HEAD/src/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"f29f84d9f963b618","mcp_get_code":{"code_sha256":"f29f84d9f963b618"}},{"arxiv_id":"2410.21795","paper":"/paper/robot-policy-learning-with-temporal-optimal","title":"Robot Policy Learning with Temporal Optimal Transport Reward","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fuyw/temporalot","path":"models/temporalot.py","file_url":"https://github.com/fuyw/temporalot/blob/HEAD/models/temporalot.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bac5b63bccf2761a","mcp_get_code":{"code_sha256":"bac5b63bccf2761a"}},{"arxiv_id":"2410.08979","paper":"/paper/overcoming-slow-decision-frequencies-in","title":"Overcoming Slow Decision Frequencies in Continuous Control: Model-Based Sequence Reinforcement Learning for Model-Free Control","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dee0512/Temporally-Layered-Architecture","path":"model.py","file_url":"https://github.com/dee0512/Temporally-Layered-Architecture/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"464ed648e3d7a3e2","mcp_get_code":{"code_sha256":"464ed648e3d7a3e2"}},{"arxiv_id":"2406.16255","paper":"/paper/uncertainty-aware-reward-free-exploration","title":"Uncertainty-Aware Reward-Free Exploration with General Function Approximation","date":"2024-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uclaml/gfa-rfe","path":"agent/dsquare.py","file_url":"https://github.com/uclaml/gfa-rfe/blob/HEAD/agent/dsquare.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"419af119bd09b0ac","mcp_get_code":{"code_sha256":"419af119bd09b0ac"}},{"arxiv_id":"2406.13909","paper":"/paper/beyond-optimism-exploration-with-partially","title":"Beyond Optimism: Exploration With Partially Observable Rewards","date":"2024-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AmiiThinks/mon_mdp_neurips24","path":"src/actor.py","file_url":"https://github.com/AmiiThinks/mon_mdp_neurips24/blob/HEAD/src/actor.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC-BY-4.0","inline_ok":false,"code_sha256_prefix":"bce144a0a54c2361","mcp_get_code":{"code_sha256":"bce144a0a54c2361"}},{"arxiv_id":"2405.16158","paper":"/paper/bigger-regularized-optimistic-scaling-for","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","date":"2024-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/TD3","path":"TD3.py","file_url":"https://github.com/sfujim/TD3/blob/HEAD/TD3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9c81de6b9c4c134f","mcp_get_code":{"code_sha256":"9c81de6b9c4c134f"}},{"arxiv_id":"2402.12181","paper":"/paper/revisiting-data-augmentation-in-deep","title":"Revisiting Data Augmentation in Deep Reinforcement Learning","date":"2024-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jianshu-hu/drqv2","path":"drqv2.py","file_url":"https://github.com/jianshu-hu/drqv2/blob/HEAD/drqv2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cc3f9517e01dd145","mcp_get_code":{"code_sha256":"cc3f9517e01dd145"}},{"arxiv_id":"2310.19668","paper":"/paper/drm-mastering-visual-reinforcement-learning","title":"DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"XuGW-Kevin/DrM","path":"agents/drm.py","file_url":"https://github.com/XuGW-Kevin/DrM/blob/HEAD/agents/drm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ac279413d97dfbb0","mcp_get_code":{"code_sha256":"ac279413d97dfbb0"}},{"arxiv_id":"2310.12955","paper":"/paper/towards-robust-offline-reinforcement-learning","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","date":"2023-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/ORL","path":"riql/riql.py","file_url":"https://github.com/zzmtsvv/ORL/blob/HEAD/riql/riql.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3a5956686dfd460b","mcp_get_code":{"code_sha256":"3a5956686dfd460b"}},{"arxiv_id":"2310.07418","paper":"/paper/revisiting-plasticity-in-visual-reinforcement","title":"Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages","date":"2023-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Guozheng-Ma/Adaptive-Replay-Ratio","path":"drqv2_adapt_rr.py","file_url":"https://github.com/Guozheng-Ma/Adaptive-Replay-Ratio/blob/HEAD/drqv2_adapt_rr.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4f9c561e7f66c0aa","mcp_get_code":{"code_sha256":"4f9c561e7f66c0aa"}},{"arxiv_id":"2307.11620","paper":"/paper/offline-multi-agent-reinforcement-learning-1","title":"Offline Multi-Agent Reinforcement Learning with Implicit Global-to-Local Value Regularization","date":"2023-07-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhengyinan-air/omiga","path":"algos/OMIGA.py","file_url":"https://github.com/zhengyinan-air/omiga/blob/HEAD/algos/OMIGA.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5eb07edf75209baa","mcp_get_code":{"code_sha256":"5eb07edf75209baa"}},{"arxiv_id":"2306.06569","paper":"/paper/policy-regularization-with-dataset-constraint","title":"Policy Regularization with Dataset Constraint for Offline Reinforcement Learning","date":"2023-06-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lamda-rl/prdc","path":"prdc.py","file_url":"https://github.com/lamda-rl/prdc/blob/HEAD/prdc.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b6bad7ca8ac45549","mcp_get_code":{"code_sha256":"b6bad7ca8ac45549"}},{"arxiv_id":"2306.00398","paper":"/paper/preference-grounded-token-level-guidance-for-1","title":"Preference-grounded Token-level Guidance for Language Model Fine-tuning","date":"2023-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yinyueqin/denserewardrlhf-ppo","path":"denserlhf/trainer/ppo_utils/experience_maker.py","file_url":"https://github.com/yinyueqin/denserewardrlhf-ppo/blob/HEAD/denserlhf/trainer/ppo_utils/experience_maker.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2c1a919b8596c263","mcp_get_code":{"code_sha256":"2c1a919b8596c263"}},{"arxiv_id":"2305.12239","paper":"/paper/off-policy-average-reward-actor-critic-with","title":"Off-Policy Average Reward Actor-Critic with Deterministic Policy Search","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"namansaxena9/ARO-DDPG","path":"cheetah_run/ddpg_model.py","file_url":"https://github.com/namansaxena9/ARO-DDPG/blob/HEAD/cheetah_run/ddpg_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8dc8b64c468580f4","mcp_get_code":{"code_sha256":"8dc8b64c468580f4"}},{"arxiv_id":"2303.08447","paper":"/paper/mahtm-a-multi-agent-framework-for","title":"MAHTM: A Multi-Agent Framework for Hierarchical Transactive Microgrids","date":"2023-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicosquare/rl-energy-management","path":"src/algos/rl/coma/d_simple_microgrid.py","file_url":"https://github.com/nicosquare/rl-energy-management/blob/HEAD/src/algos/rl/coma/d_simple_microgrid.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9fe565930f928e18","mcp_get_code":{"code_sha256":"9fe565930f928e18"}},{"arxiv_id":"2301.02328","paper":"/paper/extreme-q-learning-maxent-rl-without-entropy","title":"Extreme Q-Learning: MaxEnt RL without Entropy","date":"2023-01-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/rl_task","path":"eql/eql.py","file_url":"https://github.com/zzmtsvv/rl_task/blob/HEAD/eql/eql.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f7541cc0796ce882","mcp_get_code":{"code_sha256":"f7541cc0796ce882"}},{"arxiv_id":"2211.00164","paper":"/paper/agent-controller-representations-principled","title":"Agent-Controller Representations: Principled Offline RL with Rich Exogenous Information","date":"2022-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"manantomar/agent-centric-representations","path":"acro.py","file_url":"https://github.com/manantomar/agent-centric-representations/blob/HEAD/acro.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1de9ecd6db95db2e","mcp_get_code":{"code_sha256":"1de9ecd6db95db2e"}},{"arxiv_id":"2209.08646","paper":"/paper/deeptop-deep-threshold-optimal-policy-for","title":"DeepTOP: Deep Threshold-Optimal Policy for MDPs and RMABs","date":"2022-09-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"khalednakhleh/deeptop","path":"MDP/DeepTOP.py","file_url":"https://github.com/khalednakhleh/deeptop/blob/HEAD/MDP/DeepTOP.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"3473662fd8d11551","mcp_get_code":{"code_sha256":"3473662fd8d11551"}},{"arxiv_id":"2208.05129","paper":"/paper/robust-reinforcement-learning-using-offline","title":"Robust Reinforcement Learning using Offline Data","date":"2022-08-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zaiyan-x/RFQI","path":"rfqi.py","file_url":"https://github.com/zaiyan-x/RFQI/blob/HEAD/rfqi.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bd43dccfb7a0ad6d","mcp_get_code":{"code_sha256":"bd43dccfb7a0ad6d"}},{"arxiv_id":"2207.10050","paper":"/paper/discriminator-weighted-offline-imitation-1","title":"Discriminator-Weighted Offline Imitation Learning from Suboptimal Demonstrations","date":"2022-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zexusun/oilca-neurips23","path":"algos/augment_DWBC.py","file_url":"https://github.com/zexusun/oilca-neurips23/blob/HEAD/algos/augment_DWBC.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b6455496f9ccd9d2","mcp_get_code":{"code_sha256":"b6455496f9ccd9d2"}},{"arxiv_id":"2207.05837","paper":"/paper/learning-bellman-complete-representations-for","title":"Learning Bellman Complete Representations for Offline Policy Evaluation","date":"2022-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"causalml/bcrl","path":"bcrl/agent.py","file_url":"https://github.com/causalml/bcrl/blob/HEAD/bcrl/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5b1fa9891b2abef9","mcp_get_code":{"code_sha256":"5b1fa9891b2abef9"}},{"arxiv_id":"2206.08853","paper":"/paper/minedojo-building-open-ended-embodied-agents","title":"MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge","date":"2022-06-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pku-rl/copl","path":"src/core/ppo.py","file_url":"https://github.com/pku-rl/copl/blob/HEAD/src/core/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7afc0befd6b15a83","mcp_get_code":{"code_sha256":"7afc0befd6b15a83"}},{"arxiv_id":"2206.04745","paper":"/paper/mildly-conservative-q-learning-for-offline","title":"Mildly Conservative Q-Learning for Offline Reinforcement Learning","date":"2022-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/ORL","path":"mcq/mcq.py","file_url":"https://github.com/zzmtsvv/ORL/blob/HEAD/mcq/mcq.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"55a4cdf8fa60dd90","mcp_get_code":{"code_sha256":"55a4cdf8fa60dd90"}},{"arxiv_id":"2205.00943","paper":"/paper/cclf-a-contrastive-curiosity-driven-learning","title":"CCLF: A Contrastive-Curiosity-Driven Learning Framework for Sample-Efficient Reinforcement Learning","date":"2022-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csun001/CCLF","path":"CCLF_sac.py","file_url":"https://github.com/csun001/CCLF/blob/HEAD/CCLF_sac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9d46b0bfcafbd714","mcp_get_code":{"code_sha256":"9d46b0bfcafbd714"}},{"arxiv_id":"2203.08553","paper":"/paper/pmic-improving-multi-agent-reinforcement-1","title":"PMIC: Improving Multi-Agent Reinforcement Learning with Progressive Mutual Information Collaboration","date":"2022-03-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yeshenpy/pmic","path":"algorithms/mpe_new_maxminMADDPG.py","file_url":"https://github.com/yeshenpy/pmic/blob/HEAD/algorithms/mpe_new_maxminMADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"02d8b297accf97de","mcp_get_code":{"code_sha256":"02d8b297accf97de"}},{"arxiv_id":"2202.10324","paper":"/paper/vrl3-a-data-driven-framework-for-visual-deep","title":"VRL3: A Data-Driven Framework for Visual Deep Reinforcement Learning","date":"2022-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/drqv2","path":"drqv2.py","file_url":"https://github.com/facebookresearch/drqv2/blob/HEAD/drqv2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"23bd8540206300a8","mcp_get_code":{"code_sha256":"23bd8540206300a8"}},{"arxiv_id":"2202.05244","paper":"/paper/revolver-continuous-evolutionary-models-for","title":"REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer","date":"2022-02-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xingyul/revolver","path":"gym/SAC.py","file_url":"https://github.com/xingyul/revolver/blob/HEAD/gym/SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-2.0","inline_ok":false,"code_sha256_prefix":"2bafdd50987880d8","mcp_get_code":{"code_sha256":"2bafdd50987880d8"}},{"arxiv_id":"2202.02433","paper":"/paper/smodice-versatile-offline-imitation-learning","title":"Versatile Offline Imitation from Observations and Examples via Regularized State-Occupancy Matching","date":"2022-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ryanxhr/dwbc","path":"algos/DWBC.py","file_url":"https://github.com/ryanxhr/dwbc/blob/HEAD/algos/DWBC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"da00c16c9fad3d61","mcp_get_code":{"code_sha256":"da00c16c9fad3d61"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"orrivlin/implicit-q-learning","path":"IQL.py","file_url":"https://github.com/orrivlin/implicit-q-learning/blob/HEAD/IQL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"9a453c413229c3e8","mcp_get_code":{"code_sha256":"9a453c413229c3e8"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Manchery/iql-pytorch","path":"IQL.py","file_url":"https://github.com/Manchery/iql-pytorch/blob/HEAD/IQL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"966c8f4b02ba3120","mcp_get_code":{"code_sha256":"966c8f4b02ba3120"}},{"arxiv_id":"2110.06169","paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Implicit-Q-Learning","path":"agent.py","file_url":"https://github.com/BY571/Implicit-Q-Learning/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b6a1eedb944158c8","mcp_get_code":{"code_sha256":"b6a1eedb944158c8"}},{"arxiv_id":"2110.02544","paper":"/paper/learning-to-iteratively-solve-routing","title":"Learning to Iteratively Solve Routing Problems with Dual-Aspect Collaborative Transformer","date":"2021-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yining043/VRP-DACT","path":"nets/actor_network.py","file_url":"https://github.com/yining043/VRP-DACT/blob/HEAD/nets/actor_network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c62ea025f6578059","mcp_get_code":{"code_sha256":"c62ea025f6578059"}},{"arxiv_id":"2110.01548","paper":"/paper/uncertainty-based-offline-reinforcement","title":"Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble","date":"2021-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"corl-team/CORL","path":"algorithms/offline/edac.py","file_url":"https://github.com/corl-team/CORL/blob/HEAD/algorithms/offline/edac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"7f11d5ce17556f04","mcp_get_code":{"code_sha256":"7f11d5ce17556f04"}},{"arxiv_id":"2110.01528","paper":"/paper/large-batch-experience-replay","title":"Large Batch Experience Replay","date":"2021-10-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sureli/laber","path":"LaBER/continuous/LABER_SAC.py","file_url":"https://github.com/sureli/laber/blob/HEAD/LaBER/continuous/LABER_SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"508f079e9d0ccf91","mcp_get_code":{"code_sha256":"508f079e9d0ccf91"}},{"arxiv_id":"2107.12216","paper":"/paper/hindsight-value-function-for-variance","title":"Hindsight Value Function for Variance Reduction in Stochastic Dynamic Environment","date":"2021-07-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guojm14/HVF","path":"reduce_var/mlp.py","file_url":"https://github.com/guojm14/HVF/blob/HEAD/reduce_var/mlp.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f9dab6339e71b2bb","mcp_get_code":{"code_sha256":"f9dab6339e71b2bb"}},{"arxiv_id":"2103.01654","paper":"/paper/part2whole-iteratively-enrich-detail-for","title":"Ask&Confirm: Active Detail Enriching for Cross-Modal Retrieval with Partial Query","date":"2021-03-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CuthbertCai/Ask-Confirm","path":"models/policy_model.py","file_url":"https://github.com/CuthbertCai/Ask-Confirm/blob/HEAD/models/policy_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8a7f1e20f75ba4f3","mcp_get_code":{"code_sha256":"8a7f1e20f75ba4f3"}},{"arxiv_id":"2101.05982","paper":"/paper/randomized-ensembled-double-q-learning-1","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","date":"2021-01-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Randomized-Ensembled-Double-Q-learning-REDQ-","path":"agent.py","file_url":"https://github.com/BY571/Randomized-Ensembled-Double-Q-learning-REDQ-/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"89265e3225a6d513","mcp_get_code":{"code_sha256":"89265e3225a6d513"}},{"arxiv_id":"2010.09177","paper":"/paper/softmax-deep-double-deterministic-policy","title":"Softmax Deep Double Deterministic Policy Gradients","date":"2020-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ling-pan/SD3","path":"SD3.py","file_url":"https://github.com/ling-pan/SD3/blob/HEAD/SD3.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"62767acd88e18e64","mcp_get_code":{"code_sha256":"62767acd88e18e64"}},{"arxiv_id":"2007.04309","paper":"/paper/self-supervised-policy-adaptation-during","title":"Self-Supervised Policy Adaptation during Deployment","date":"2020-07-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicklashansen/policy-adaptation-during-deployment","path":"src/agent/agent.py","file_url":"https://github.com/nicklashansen/policy-adaptation-during-deployment/blob/HEAD/src/agent/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d526a377580646ff","mcp_get_code":{"code_sha256":"d526a377580646ff"}},{"arxiv_id":"2006.11485","paper":"/paper/generating-adjacency-constrained-subgoals-in","title":"Generating Adjacency-Constrained Subgoals in Hierarchical Reinforcement Learning","date":"2020-06-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"trzhang0116/HRAC","path":"hrac/hrac.py","file_url":"https://github.com/trzhang0116/HRAC/blob/HEAD/hrac/hrac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1b8c1dbf0a21cb68","mcp_get_code":{"code_sha256":"1b8c1dbf0a21cb68"}},{"arxiv_id":"2006.09359","paper":"/paper/accelerating-online-reinforcement-learning","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","date":"2020-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/rl_task","path":"awac/awac.py","file_url":"https://github.com/zzmtsvv/rl_task/blob/HEAD/awac/awac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"eecebb628e9b243d","mcp_get_code":{"code_sha256":"eecebb628e9b243d"}},{"arxiv_id":"2006.04779","paper":"/paper/conservative-q-learning-for-offline","title":"Conservative Q-Learning for Offline Reinforcement Learning","date":"2020-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/CQL","path":"CQL-SAC/agent.py","file_url":"https://github.com/BY571/CQL/blob/HEAD/CQL-SAC/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"34ba8aa41bb7fa58","mcp_get_code":{"code_sha256":"34ba8aa41bb7fa58"}},{"arxiv_id":"2004.14990","paper":"/paper/reinforcement-learning-with-augmented-data","title":"Reinforcement Learning with Augmented Data","date":"2020-04-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MishaLaskin/rad","path":"curl_sac.py","file_url":"https://github.com/MishaLaskin/rad/blob/HEAD/curl_sac.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5aaa7c97de18af3a","mcp_get_code":{"code_sha256":"5aaa7c97de18af3a"}},{"arxiv_id":"2004.13649","paper":"/paper/image-augmentation-is-all-you-need","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","date":"2020-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xingyu-lin/softagent","path":"drq/Drq.py","file_url":"https://github.com/xingyu-lin/softagent/blob/HEAD/drq/Drq.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8ad237c6d1f93986","mcp_get_code":{"code_sha256":"8ad237c6d1f93986"}},{"arxiv_id":"2004.06748","paper":"/paper/balancing-training-for-multilingual-neural","title":"Balancing Training for Multilingual Neural Machine Translation","date":"2020-04-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cindyxinyiwang/DataSelection","path":"src/actor.py","file_url":"https://github.com/cindyxinyiwang/DataSelection/blob/HEAD/src/actor.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"824df24cce12a367","mcp_get_code":{"code_sha256":"824df24cce12a367"}},{"arxiv_id":"2003.05334","paper":"/paper/online-meta-critic-learning-for-off-policy-1","title":"Online Meta-Critic Learning for Off-Policy Actor-Critic Methods","date":"2020-03-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zwfightzw/Meta-Critic","path":"TD3_DDPG_MC/DDPG_MC.py","file_url":"https://github.com/zwfightzw/Meta-Critic/blob/HEAD/TD3_DDPG_MC/DDPG_MC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d263091df5df7826","mcp_get_code":{"code_sha256":"d263091df5df7826"}},{"arxiv_id":"2002.09505","paper":"/paper/estimating-qss-with-deep-deterministic","title":"Estimating Q(s,s') with Deep Deterministic Dynamics Gradients","date":"2020-02-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uber-research/D3G","path":"D3G/D3G.py","file_url":"https://github.com/uber-research/D3G/blob/HEAD/D3G/D3G.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"87d8bb6bd7e83fe9","mcp_get_code":{"code_sha256":"87d8bb6bd7e83fe9"}},{"arxiv_id":"2002.00632","paper":"/paper/effective-diversity-in-population-based","title":"Effective Diversity in Population Based Reinforcement Learning","date":"2020-02-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"holounic/DvD-TD3","path":"td3/algorithm.py","file_url":"https://github.com/holounic/DvD-TD3/blob/HEAD/td3/algorithm.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"01cff9d67cdcaecf","mcp_get_code":{"code_sha256":"01cff9d67cdcaecf"}},{"arxiv_id":"1906.00949","paper":"/paper/190600949","title":"Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction","date":"2019-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zzmtsvv/rl_task","path":"bear/bear.py","file_url":"https://github.com/zzmtsvv/rl_task/blob/HEAD/bear/bear.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"434fd896deb0893a","mcp_get_code":{"code_sha256":"434fd896deb0893a"}},{"arxiv_id":"1812.02900","paper":"/paper/off-policy-deep-reinforcement-learning","title":"Off-Policy Deep Reinforcement Learning without Exploration","date":"2018-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"theSparta/off_policy_mujoco","path":"RSEM.py","file_url":"https://github.com/theSparta/off_policy_mujoco/blob/HEAD/RSEM.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a4c895a75dcac04b","mcp_get_code":{"code_sha256":"a4c895a75dcac04b"}},{"arxiv_id":"1812.02900","paper":"/paper/off-policy-deep-reinforcement-learning","title":"Off-Policy Deep Reinforcement Learning without Exploration","date":"2018-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maziarg/PrivAttack-BCQ","path":"continuous_BCQ/BCQ.py","file_url":"https://github.com/maziarg/PrivAttack-BCQ/blob/HEAD/continuous_BCQ/BCQ.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fa0f609acc14b1b7","mcp_get_code":{"code_sha256":"fa0f609acc14b1b7"}},{"arxiv_id":"1812.02900","paper":"/paper/off-policy-deep-reinforcement-learning","title":"Off-Policy Deep Reinforcement Learning without Exploration","date":"2018-12-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thxsxth/POMDP_RLSepsis","path":"RL/other RL attempts/BCQ_models.py","file_url":"https://github.com/thxsxth/POMDP_RLSepsis/blob/HEAD/RL/other%20RL%20attempts/BCQ_models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f8f318e0c81d2112","mcp_get_code":{"code_sha256":"f8f318e0c81d2112"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning","path":"src/agents.py","file_url":"https://github.com/MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning/blob/HEAD/src/agents.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"de5e64dc2bfc6a33","mcp_get_code":{"code_sha256":"de5e64dc2bfc6a33"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Soft-Actor-Critic-and-Extensions","path":"files/Agent.py","file_url":"https://github.com/BY571/Soft-Actor-Critic-and-Extensions/blob/HEAD/files/Agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5d8f81c210a0aacb","mcp_get_code":{"code_sha256":"5d8f81c210a0aacb"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SaminYeasar/off_policy_ac","path":"SAC/SAC.py","file_url":"https://github.com/SaminYeasar/off_policy_ac/blob/HEAD/SAC/SAC.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dc01224a73ea8148","mcp_get_code":{"code_sha256":"dc01224a73ea8148"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/PPO-Reacher_UnityML","path":"agent.py","file_url":"https://github.com/bonniesjli/PPO-Reacher_UnityML/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e9f1207fc08f9fa9","mcp_get_code":{"code_sha256":"e9f1207fc08f9fa9"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/PPO_Reacher","path":"agent.py","file_url":"https://github.com/bonniesjli/PPO_Reacher/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8fc0ce07edd32744","mcp_get_code":{"code_sha256":"8fc0ce07edd32744"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Gregory-Eales/proximal-policy-optimization","path":"ppo/modules/ppo.py","file_url":"https://github.com/Gregory-Eales/proximal-policy-optimization/blob/HEAD/ppo/modules/ppo.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c3cb4b39b7e82812","mcp_get_code":{"code_sha256":"c3cb4b39b7e82812"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"PPO/PPO_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/PPO/PPO_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"54ccb8ae3f658c83","mcp_get_code":{"code_sha256":"54ccb8ae3f658c83"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"PPO.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/PPO.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bf0c1da602f8a16d","mcp_get_code":{"code_sha256":"bf0c1da602f8a16d"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zowiezhang/stas","path":"models/policy/COMA.py","file_url":"https://github.com/zowiezhang/stas/blob/HEAD/models/policy/COMA.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d33580612fa8578d","mcp_get_code":{"code_sha256":"d33580612fa8578d"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rainandwind1/MADDPG-reconstruct","path":"MADDPG/model.py","file_url":"https://github.com/rainandwind1/MADDPG-reconstruct/blob/HEAD/MADDPG/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"394e91b566a8e7eb","mcp_get_code":{"code_sha256":"394e91b566a8e7eb"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrDaubinet/collaboration-and-competition","path":"maddpg.py","file_url":"https://github.com/MrDaubinet/collaboration-and-competition/blob/HEAD/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"147d57177bbffdd9","mcp_get_code":{"code_sha256":"147d57177bbffdd9"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"starry-sky6688/MADDPG","path":"maddpg/maddpg.py","file_url":"https://github.com/starry-sky6688/MADDPG/blob/HEAD/maddpg/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b1b715fc5cea22be","mcp_get_code":{"code_sha256":"b1b715fc5cea22be"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"krasing/DRLearningCollaboration","path":"failed_collaborative/ddpg_agent_multi_2.py","file_url":"https://github.com/krasing/DRLearningCollaboration/blob/HEAD/failed_collaborative/ddpg_agent_multi_2.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ab8b87babe2b659e","mcp_get_code":{"code_sha256":"ab8b87babe2b659e"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity","path":"multiagent_resources.py","file_url":"https://github.com/petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity/blob/HEAD/multiagent_resources.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a17bd67f978b7355","mcp_get_code":{"code_sha256":"a17bd67f978b7355"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"isp1tze/MAProj","path":"algo/maddpg/maddpg_agent.py","file_url":"https://github.com/isp1tze/MAProj/blob/HEAD/algo/maddpg/maddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"cbd481c5cf284628","mcp_get_code":{"code_sha256":"cbd481c5cf284628"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/MADDPG_Tennis_UnityML","path":"MADDPG.py","file_url":"https://github.com/bonniesjli/MADDPG_Tennis_UnityML/blob/HEAD/MADDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"af7b2cc00bcf3971","mcp_get_code":{"code_sha256":"af7b2cc00bcf3971"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thechrisyoon08/marl","path":"MADDPG/maddpg.py","file_url":"https://github.com/thechrisyoon08/marl/blob/HEAD/MADDPG/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"19cc670e3070c844","mcp_get_code":{"code_sha256":"19cc670e3070c844"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Ah31/maddpg_pytorch","path":"MADDPG_model.py","file_url":"https://github.com/Ah31/maddpg_pytorch/blob/HEAD/MADDPG_model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e0a77db60f82cb02","mcp_get_code":{"code_sha256":"e0a77db60f82cb02"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ksajan/DDPG-MAPE","path":"multiagent-particle-envs/maddpg.py","file_url":"https://github.com/ksajan/DDPG-MAPE/blob/HEAD/multiagent-particle-envs/maddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"85e19366b66e12c8","mcp_get_code":{"code_sha256":"85e19366b66e12c8"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anonymous-iclr22/trust-region-in-multi-agent-reinforcement-learning","path":"algorithms/happo_policy.py","file_url":"https://github.com/anonymous-iclr22/trust-region-in-multi-agent-reinforcement-learning/blob/HEAD/algorithms/happo_policy.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fe0a30f4af252b51","mcp_get_code":{"code_sha256":"fe0a30f4af252b51"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Remtasya/DDPG-Actor-Critic-Reinforcement-Learning-Reacher-Environment","path":"ddpg_agent.py","file_url":"https://github.com/Remtasya/DDPG-Actor-Critic-Reinforcement-Learning-Reacher-Environment/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a83ecbc1e78102e4","mcp_get_code":{"code_sha256":"a83ecbc1e78102e4"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bentrevett/pytorch-rl","path":"n_step_a2c.py","file_url":"https://github.com/bentrevett/pytorch-rl/blob/HEAD/n_step_a2c.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"75bd98e327fba9f3","mcp_get_code":{"code_sha256":"75bd98e327fba9f3"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"A2C.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/A2C.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4dd9b378deccacfd","mcp_get_code":{"code_sha256":"4dd9b378deccacfd"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"A3C/A3C_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/A3C/A3C_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"223dec3bdd457c46","mcp_get_code":{"code_sha256":"223dec3bdd457c46"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ghliu/pytorch-ddpg","path":"ddpg.py","file_url":"https://github.com/ghliu/pytorch-ddpg/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fb986aef8cb19dcb","mcp_get_code":{"code_sha256":"fb986aef8cb19dcb"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient","path":"ddpg_agent.py","file_url":"https://github.com/iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"64db7b42a6e83850","mcp_get_code":{"code_sha256":"64db7b42a6e83850"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TheInfamousWayne/ddpg","path":"ddpg.py","file_url":"https://github.com/TheInfamousWayne/ddpg/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"976480803a792876","mcp_get_code":{"code_sha256":"976480803a792876"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"J93T/TP4-DDPG","path":"ddpg.py","file_url":"https://github.com/J93T/TP4-DDPG/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6d718c5a05a53b10","mcp_get_code":{"code_sha256":"6d718c5a05a53b10"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HJDQN/HJQ","path":"algorithms/ddpg/ddpg.py","file_url":"https://github.com/HJDQN/HJQ/blob/HEAD/algorithms/ddpg/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4ea2dabac66df07c","mcp_get_code":{"code_sha256":"4ea2dabac66df07c"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env","path":"ddpg_agent.py","file_url":"https://github.com/IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"2233e3bf2203e01d","mcp_get_code":{"code_sha256":"2233e3bf2203e01d"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baturaysaglam/ac-off-poc","path":"DDPG & TD3/AC_Off_POC_DDPG.py","file_url":"https://github.com/baturaysaglam/ac-off-poc/blob/HEAD/DDPG%20%26%20TD3/AC_Off_POC_DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"024ce7deaed96813","mcp_get_code":{"code_sha256":"024ce7deaed96813"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"b06b01073/continuous-control","path":"ddpg.py","file_url":"https://github.com/b06b01073/continuous-control/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b7b4ba4db14ceff3","mcp_get_code":{"code_sha256":"b7b4ba4db14ceff3"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZainRaza14/deepRL","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/ZainRaza14/deepRL/blob/HEAD/DDPG/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8062e958090e2e1f","mcp_get_code":{"code_sha256":"8062e958090e2e1f"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madhur-tandon/RL-Project","path":"agent.py","file_url":"https://github.com/madhur-tandon/RL-Project/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c3081f2569beb64e","mcp_get_code":{"code_sha256":"c3081f2569beb64e"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"biemann/Continuous-Control","path":"ddpg_agent.py","file_url":"https://github.com/biemann/Continuous-Control/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"59b451ca369c1de8","mcp_get_code":{"code_sha256":"59b451ca369c1de8"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"krasing/DRLearningContinuousControl","path":"ddpg_agent.py","file_url":"https://github.com/krasing/DRLearningContinuousControl/blob/HEAD/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"dc8d86e2dc6fd389","mcp_get_code":{"code_sha256":"dc8d86e2dc6fd389"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baturaysaglam/RIS-MISO-Deep-Reinforcement-Learning","path":"DDPG.py","file_url":"https://github.com/baturaysaglam/RIS-MISO-Deep-Reinforcement-Learning/blob/HEAD/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6eca632bf823e7db","mcp_get_code":{"code_sha256":"6eca632bf823e7db"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SergiPonsa/Reinforcement-Learning-Sergi","path":"ddpg pendulum/model_comented.py","file_url":"https://github.com/SergiPonsa/Reinforcement-Learning-Sergi/blob/HEAD/ddpg%20pendulum/model_comented.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"da2a0693988d4238","mcp_get_code":{"code_sha256":"da2a0693988d4238"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"hemilpanchiwala/Hindsight-Experience-Replay","path":"ddpg_with_her/DDPGAgent.py","file_url":"https://github.com/hemilpanchiwala/Hindsight-Experience-Replay/blob/HEAD/ddpg_with_her/DDPGAgent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"00d63e51f73faefb","mcp_get_code":{"code_sha256":"00d63e51f73faefb"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"krasing/DRLearningCollaboration","path":"model.py","file_url":"https://github.com/krasing/DRLearningCollaboration/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b0866a4da4a62415","mcp_get_code":{"code_sha256":"b0866a4da4a62415"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"claudeHifly/BipedalWalker-v3","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/claudeHifly/BipedalWalker-v3/blob/HEAD/DDPG/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"328c50f6e3095851","mcp_get_code":{"code_sha256":"328c50f6e3095851"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wwydmanski/rl_tennis","path":"brain/model.py","file_url":"https://github.com/wwydmanski/rl_tennis/blob/HEAD/brain/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"462527aca7c44cd5","mcp_get_code":{"code_sha256":"462527aca7c44cd5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZiyangY/IndProject-RL-in-Supply-chain","path":"DDPG-based RNN/DDPG.py","file_url":"https://github.com/ZiyangY/IndProject-RL-in-Supply-chain/blob/HEAD/DDPG-based%20RNN/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1f1a916ff3cde3a5","mcp_get_code":{"code_sha256":"1f1a916ff3cde3a5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDataist/Tennis-With-Multi-Agent-Reinforcement","path":"model.py","file_url":"https://github.com/iDataist/Tennis-With-Multi-Agent-Reinforcement/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d96d6110c00ab9d4","mcp_get_code":{"code_sha256":"d96d6110c00ab9d4"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Philori22/DDPG-aigym","path":"ddpg.py","file_url":"https://github.com/Philori22/DDPG-aigym/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8f5c14d98d39f3b9","mcp_get_code":{"code_sha256":"8f5c14d98d39f3b9"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"SaminYeasar/off_policy_ac","path":"DDPG/DDPG.py","file_url":"https://github.com/SaminYeasar/off_policy_ac/blob/HEAD/DDPG/DDPG.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"200b44ea7ead9ab6","mcp_get_code":{"code_sha256":"200b44ea7ead9ab6"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fshamshirdar/pytorch-rdpg","path":"rdpg.py","file_url":"https://github.com/fshamshirdar/pytorch-rdpg/blob/HEAD/rdpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"958765de0feeec56","mcp_get_code":{"code_sha256":"958765de0feeec56"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dan-lennox/ml-udacity-quadcopter-rl","path":"agents/agent.py","file_url":"https://github.com/dan-lennox/ml-udacity-quadcopter-rl/blob/HEAD/agents/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8bd7d62053fbfae5","mcp_get_code":{"code_sha256":"8bd7d62053fbfae5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"halajadallah/RL-Quadcopter_project","path":"agents/agent_modified.py","file_url":"https://github.com/halajadallah/RL-Quadcopter_project/blob/HEAD/agents/agent_modified.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"75b2da574221eee2","mcp_get_code":{"code_sha256":"75b2da574221eee2"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"InSpaceAI/RL-Zoo","path":"DDPG.py","file_url":"https://github.com/InSpaceAI/RL-Zoo/blob/HEAD/DDPG.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8afc63f093262b83","mcp_get_code":{"code_sha256":"8afc63f093262b83"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Gouet/DDPG_PendulumV1","path":"ddpg.py","file_url":"https://github.com/Gouet/DDPG_PendulumV1/blob/HEAD/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4abb7a0681b9f8e3","mcp_get_code":{"code_sha256":"4abb7a0681b9f8e3"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madvn/DDPG","path":"ddpg/ddpg.py","file_url":"https://github.com/madvn/DDPG/blob/HEAD/ddpg/ddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b9b27fa7acc7c73f","mcp_get_code":{"code_sha256":"b9b27fa7acc7c73f"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shahabi8/Deep-Reinforcement-Learning","path":"DDGP.py","file_url":"https://github.com/shahabi8/Deep-Reinforcement-Learning/blob/HEAD/DDGP.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ef0c12a6692597db","mcp_get_code":{"code_sha256":"ef0c12a6692597db"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alathiya/RL-Quadcoptor-Flying","path":"agents/agent.py","file_url":"https://github.com/alathiya/RL-Quadcoptor-Flying/blob/HEAD/agents/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f6231123b603e20f","mcp_get_code":{"code_sha256":"f6231123b603e20f"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dyth/doublegum","path":"policies_cont/agents/DDPG.py","file_url":"https://github.com/dyth/doublegum/blob/HEAD/policies_cont/agents/DDPG.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"c5cbbbbfdd3a367c","mcp_get_code":{"code_sha256":"c5cbbbbfdd3a367c"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DDPG/DDPG_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DDPG/DDPG_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8f5f60d9f1d5e30f","mcp_get_code":{"code_sha256":"8f5f60d9f1d5e30f"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abbadka/quadcopter","path":"agents/ddpg/agent.py","file_url":"https://github.com/abbadka/quadcopter/blob/HEAD/agents/ddpg/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"017ef34f0499756e","mcp_get_code":{"code_sha256":"017ef34f0499756e"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fhbzc/FishAgentSimulation","path":"train_RL.py","file_url":"https://github.com/fhbzc/FishAgentSimulation/blob/HEAD/train_RL.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0d51c1e5212918ec","mcp_get_code":{"code_sha256":"0d51c1e5212918ec"}},{"arxiv_id":"ijcai2025_0648","paper":null,"title":"arXiv:ijcai2025_0648","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"BW297/FACD","path":"model/FACD.py","file_url":"https://github.com/BW297/FACD/blob/HEAD/model/FACD.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"698d2cb357caa103","mcp_get_code":{"code_sha256":"698d2cb357caa103"}}]}