{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/agent","entry":"Agent","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":42,"n_papers_ran":18,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":83,"n_samples_ran":23,"n_samples_fingerprinted":0,"n_places":83,"n_places_pointer_only":45,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":23,"unverified":60},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2605.30052","paper":"/paper/arxiv-2605-30052","title":"REPOT: Recoverable Program-of-Thought via Checkpoint Repair *","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"parsa-mz/RePot","path":"repot/agents/repot/agent.py","file_url":"https://github.com/parsa-mz/RePot/blob/HEAD/repot/agents/repot/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f81a068f9b874a73","mcp_get_code":{"code_sha256":"f81a068f9b874a73"}},{"arxiv_id":"2605.22138","paper":"/paper/arxiv-2605-22138","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"sailing-lab/sr2am","path":"run_agent.py","file_url":"https://github.com/sailing-lab/sr2am/blob/HEAD/run_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"07732ce05478c0d3","mcp_get_code":{"code_sha256":"07732ce05478c0d3"}},{"arxiv_id":"2605.21557","paper":"/paper/arxiv-2605-21557","title":"Scalable Reinforcement Learning via Adaptive Batch Scaling","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"daisophila/ABS","path":"algos/ppo_continuous_action_ours.py","file_url":"https://github.com/daisophila/ABS/blob/HEAD/algos/ppo_continuous_action_ours.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"188eb00985155231","mcp_get_code":{"code_sha256":"188eb00985155231"}},{"arxiv_id":"2605.11711","paper":"/paper/arxiv-2605-11711","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"dmksjfl/DR.Q","path":"DRQ/DRQ.py","file_url":"https://github.com/dmksjfl/DR.Q/blob/HEAD/DRQ/DRQ.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8e691372e3738b39","mcp_get_code":{"code_sha256":"8e691372e3738b39"}},{"arxiv_id":"2601.21754","paper":"/paper/arxiv-2601-21754","title":"Language-based Trial and Error Falls Behind in the Era of Experience","date":"2026-01-29","month_inferred_from_arxiv_id":null,"title_source":"syntology","repo":"Harry-mic/SCOUT","path":"scout_ppo/ppo_frozenlake.py","file_url":"https://github.com/Harry-mic/SCOUT/blob/HEAD/scout_ppo/ppo_frozenlake.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5c7959a45ee636c0","mcp_get_code":{"code_sha256":"5c7959a45ee636c0"}},{"arxiv_id":"2601.05903","paper":"/paper/arxiv-2601-05903","title":"HAPS: Hierarchical LLM Routing with Joint Architecture and Parameter Search","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"zihangtian/HAPS","path":"HotpotQA/joint_rl/rl_batch.py","file_url":"https://github.com/zihangtian/HAPS/blob/HEAD/HotpotQA/joint_rl/rl_batch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"799d16886a6a81e3","mcp_get_code":{"code_sha256":"799d16886a6a81e3"}},{"arxiv_id":"2505.20642","paper":null,"title":"arXiv:2505.20642","date":null,"month_inferred_from_arxiv_id":"2025-05","title_source":null,"repo":"USTChandsomeboy/CoderAgent","path":"modules/learner_simulation/learner_simulation.py","file_url":"https://github.com/USTChandsomeboy/CoderAgent/blob/HEAD/modules/learner_simulation/learner_simulation.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5f06b8d961467443","mcp_get_code":{"code_sha256":"5f06b8d961467443"}},{"arxiv_id":"2503.23478","paper":"/paper/handling-delay-in-real-time-reinforcement","title":"Handling Delay in Real-Time Reinforcement Learning","date":"2025-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"avecplezir/realtime-agent","path":"nets/ppo_nets.py","file_url":"https://github.com/avecplezir/realtime-agent/blob/HEAD/nets/ppo_nets.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"45c55ef2f8e7f467","mcp_get_code":{"code_sha256":"45c55ef2f8e7f467"}},{"arxiv_id":"2502.11612","paper":"/paper/maximum-entropy-reinforcement-learning-with-1","title":"Maximum Entropy Reinforcement Learning with Diffusion Policy","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"diffusionyes/maxentdp","path":"jaxrl5/agents/score_matching/max_entropy_learner.py","file_url":"https://github.com/diffusionyes/maxentdp/blob/HEAD/jaxrl5/agents/score_matching/max_entropy_learner.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1d2b364aa107cd48","mcp_get_code":{"code_sha256":"1d2b364aa107cd48"}},{"arxiv_id":"2501.16142","paper":"/paper/towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sfujim/TD7","path":"TD7.py","file_url":"https://github.com/sfujim/TD7/blob/HEAD/TD7.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"34167534733a08e9","mcp_get_code":{"code_sha256":"34167534733a08e9"}},{"arxiv_id":"2501.16142","paper":"/paper/towards-general-purpose-model-free","title":"Towards General-Purpose Model-Free Reinforcement Learning","date":"2025-01-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/MRQ","path":"MRQ/MRQ.py","file_url":"https://github.com/facebookresearch/MRQ/blob/HEAD/MRQ/MRQ.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"186ce51f6191d32c","mcp_get_code":{"code_sha256":"186ce51f6191d32c"}},{"arxiv_id":"2411.03820","paper":"/paper/beyond-the-rainbow-high-performance-deep","title":"Beyond The Rainbow: High Performance Deep Reinforcement Learning on a Desktop PC","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rickyegl/BeyondTheRainbowICLR","path":"Agent.py","file_url":"https://github.com/rickyegl/BeyondTheRainbowICLR/blob/HEAD/Agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"286da1c5eb5d8dde","mcp_get_code":{"code_sha256":"286da1c5eb5d8dde"}},{"arxiv_id":"2411.03820","paper":"/paper/beyond-the-rainbow-high-performance-deep","title":"Beyond The Rainbow: High Performance Deep Reinforcement Learning on a Desktop PC","date":"2024-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rickyegl/BeyondTheRainbowM","path":"Agent.py","file_url":"https://github.com/rickyegl/BeyondTheRainbowM/blob/HEAD/Agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"45091c96548faa63","mcp_get_code":{"code_sha256":"45091c96548faa63"}},{"arxiv_id":"2309.13705","paper":"/paper/a-neural-guided-dynamic-symbolic-network-for","title":"A Neural-Guided Dynamic Symbolic Network for Exploring Mathematical Expressions from Data","date":"2023-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ailwq/dysymnet","path":"DySymNet/SymbolicRegression.py","file_url":"https://github.com/ailwq/dysymnet/blob/HEAD/DySymNet/SymbolicRegression.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dfa37a557d19c715","mcp_get_code":{"code_sha256":"dfa37a557d19c715"}},{"arxiv_id":"2309.08138","paper":"/paper/find-what-you-want-learning-demand-1","title":"Find What You Want: Learning Demand-conditioned Object Attribute Space for Demand-driven Navigation","date":"2023-09-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"whcpumpkin/demand-driven-navigation","path":"agent.py","file_url":"https://github.com/whcpumpkin/demand-driven-navigation/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8a5773c591ee62bd","mcp_get_code":{"code_sha256":"8a5773c591ee62bd"}},{"arxiv_id":"2305.12239","paper":"/paper/off-policy-average-reward-actor-critic-with","title":"Off-Policy Average Reward Actor-Critic with Deterministic Policy Search","date":"2023-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"namansaxena9/ARO-DDPG","path":"cheetah_run/ddpg_model.py","file_url":"https://github.com/namansaxena9/ARO-DDPG/blob/HEAD/cheetah_run/ddpg_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"18aff75275d837d5","mcp_get_code":{"code_sha256":"18aff75275d837d5"}},{"arxiv_id":"2304.13426","paper":"/paper/flex-an-adaptive-exploration-algorithm-for","title":"FLEX: an Adaptive Exploration Algorithm for Nonlinear Systems","date":"2023-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mb-29/exploration","path":"policies.py","file_url":"https://github.com/mb-29/exploration/blob/HEAD/policies.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"11c4b78255fe10ce","mcp_get_code":{"code_sha256":"11c4b78255fe10ce"}},{"arxiv_id":"2303.08447","paper":"/paper/mahtm-a-multi-agent-framework-for","title":"MAHTM: A Multi-Agent Framework for Hierarchical Transactive Microgrids","date":"2023-03-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicosquare/rl-energy-management","path":"src/algos/rl/coma/d_simple_microgrid.py","file_url":"https://github.com/nicosquare/rl-energy-management/blob/HEAD/src/algos/rl/coma/d_simple_microgrid.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"080295fa75501adf","mcp_get_code":{"code_sha256":"080295fa75501adf"}},{"arxiv_id":"2302.07510","paper":"/paper/best-arm-identification-for-stochastic-rising","title":"Best Arm Identification for Stochastic Rising Bandits","date":"2023-02-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"montenegroalessandro/bestarmidsrb","path":"agent/agent.py","file_url":"https://github.com/montenegroalessandro/bestarmidsrb/blob/HEAD/agent/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bbe2f857ba617fc6","mcp_get_code":{"code_sha256":"bbe2f857ba617fc6"}},{"arxiv_id":"2210.03629","paper":"/paper/react-synergizing-reasoning-and-acting-in","title":"ReAct: Synergizing Reasoning and Acting in Language Models","date":"2022-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sierra-research/tau-bench","path":"tau_bench/agents/chat_react_agent.py","file_url":"https://github.com/sierra-research/tau-bench/blob/HEAD/tau_bench/agents/chat_react_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bdaf067f70d6cb83","mcp_get_code":{"code_sha256":"bdaf067f70d6cb83"}},{"arxiv_id":"2203.11197","paper":"/paper/teachable-reinforcement-learning-via-advice-1","title":"Teachable Reinforcement Learning via Advice Distillation","date":"2022-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rll-research/teachable","path":"algos/hierarchical_ppo_torch.py","file_url":"https://github.com/rll-research/teachable/blob/HEAD/algos/hierarchical_ppo_torch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"18dcf30be508ff6e","mcp_get_code":{"code_sha256":"18dcf30be508ff6e"}},{"arxiv_id":"2203.11176","paper":"/paper/one-after-another-learning-incremental-skills-1","title":"One After Another: Learning Incremental Skills for a Changing World","date":"2022-03-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"notmahi/disk","path":"agent/incremental_agent.py","file_url":"https://github.com/notmahi/disk/blob/HEAD/agent/incremental_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1d85795b49649fca","mcp_get_code":{"code_sha256":"1d85795b49649fca"}},{"arxiv_id":"2202.12403","paper":"/paper/learning-transferable-reward-for-query-object-1","title":"Learning Transferable Reward for Query Object Localization with Policy Adaptation","date":"2022-02-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"litingfeng/localization-by-ordembed","path":"models/agent_model.py","file_url":"https://github.com/litingfeng/localization-by-ordembed/blob/HEAD/models/agent_model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"938d7c29215d955f","mcp_get_code":{"code_sha256":"938d7c29215d955f"}},{"arxiv_id":"2201.11927","paper":"/paper/constrained-variational-policy-optimization","title":"Constrained Variational Policy Optimization for Safe Reinforcement Learning","date":"2022-01-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zifanwu/cal","path":"agent/cal.py","file_url":"https://github.com/zifanwu/cal/blob/HEAD/agent/cal.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e5ff05aed073a821","mcp_get_code":{"code_sha256":"e5ff05aed073a821"}},{"arxiv_id":"2110.14457","paper":"/paper/direct-then-diffuse-incremental-unsupervised-1","title":"Direct then Diffuse: Incremental Unsupervised Skill Discovery for State Covering and Goal Reaching","date":"2021-10-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/salina","path":"salina_cl/agents/subspace_agents.py","file_url":"https://github.com/facebookresearch/salina/blob/HEAD/salina_cl/agents/subspace_agents.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fbfaafda487a94d1","mcp_get_code":{"code_sha256":"fbfaafda487a94d1"}},{"arxiv_id":"2110.14074","paper":"/paper/fault-tolerant-federated-reinforcement","title":"Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee","date":"2021-10-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"flint-xf-fan/Byzantine-Federeated-RL","path":"codes/agent.py","file_url":"https://github.com/flint-xf-fan/Byzantine-Federeated-RL/blob/HEAD/codes/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"052599b7eaa47863","mcp_get_code":{"code_sha256":"052599b7eaa47863"}},{"arxiv_id":"2110.14074","paper":"/paper/fault-tolerant-federated-reinforcement","title":"Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee","date":"2021-10-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anoxia-1/Fault-Tolerant-Federated-Reinforcement-Learning-with-Theoretical-Guarantee-","path":"agent.py","file_url":"https://github.com/anoxia-1/Fault-Tolerant-Federated-Reinforcement-Learning-with-Theoretical-Guarantee-/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c2acf545fc3cb392","mcp_get_code":{"code_sha256":"c2acf545fc3cb392"}},{"arxiv_id":"2110.10083","paper":"/paper/contrastive-active-inference","title":"Contrastive Active Inference","date":"2021-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mazpie/contrastive-aif","path":"agents.py","file_url":"https://github.com/mazpie/contrastive-aif/blob/HEAD/agents.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"75ec50fcae15b56d","mcp_get_code":{"code_sha256":"75ec50fcae15b56d"}},{"arxiv_id":"2109.05490","paper":"/paper/hyar-addressing-discrete-continuous-action","title":"HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation","date":"2021-09-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cycraig/MP-DQN","path":"agents/pdqn.py","file_url":"https://github.com/cycraig/MP-DQN/blob/HEAD/agents/pdqn.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cc8c1a2169afb326","mcp_get_code":{"code_sha256":"cc8c1a2169afb326"}},{"arxiv_id":"2109.04101","paper":"/paper/timetraveler-reinforcement-learning-for","title":"TimeTraveler: Reinforcement Learning for Temporal Knowledge Graph Forecasting","date":"2021-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jhl-hust/titer","path":"model/agent.py","file_url":"https://github.com/jhl-hust/titer/blob/HEAD/model/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"25b071340b057db5","mcp_get_code":{"code_sha256":"25b071340b057db5"}},{"arxiv_id":"2106.01345","paper":"/paper/decision-transformer-reinforcement-learning","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/salina","path":"salina_examples/offline_rl/decision_transformer/agents.py","file_url":"https://github.com/facebookresearch/salina/blob/HEAD/salina_examples/offline_rl/decision_transformer/agents.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"89113bc52fb73297","mcp_get_code":{"code_sha256":"89113bc52fb73297"}},{"arxiv_id":"2104.12820","paper":"/paper/universal-off-policy-evaluation","title":"Universal Off-Policy Evaluation","date":"2021-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yashchandak/UnO","path":"Src/Algorithms/Agent.py","file_url":"https://github.com/yashchandak/UnO/blob/HEAD/Src/Algorithms/Agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"9d3781f117099586","mcp_get_code":{"code_sha256":"9d3781f117099586"}},{"arxiv_id":"2101.04237","paper":"/paper/solving-common-payoff-games-with-approximate","title":"Solving Common-Payoff Games with Approximate Policy Iteration","date":"2021-01-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ssokota/capi","path":"capi/agents.py","file_url":"https://github.com/ssokota/capi/blob/HEAD/capi/agents.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f75ce66758a1ed20","mcp_get_code":{"code_sha256":"f75ce66758a1ed20"}},{"arxiv_id":"2005.00689","paper":"/paper/an-imitation-game-for-learning-semantic","title":"An Imitation Game for Learning Semantic Parsers from User Interaction","date":"2020-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sunlab-osu/MISP","path":"MISP_SQL/agent.py","file_url":"https://github.com/sunlab-osu/MISP/blob/HEAD/MISP_SQL/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"157e31aa80c0b736","mcp_get_code":{"code_sha256":"157e31aa80c0b736"}},{"arxiv_id":"2002.05780","paper":"/paper/reinforcement-learning-based-portfolio","title":"Reinforcement-Learning based Portfolio Management with Augmented Asset Movement Prediction States","date":"2020-02-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"andreaslillevangbech/PortfolioManager-pytorch","path":"src/agent.py","file_url":"https://github.com/andreaslillevangbech/PortfolioManager-pytorch/blob/HEAD/src/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ecccf7de2b610d26","mcp_get_code":{"code_sha256":"ecccf7de2b610d26"}},{"arxiv_id":"2001.00461","paper":"/paper/reasoning-on-knowledge-graphs-with-debate","title":"Reasoning on Knowledge Graphs with Debate Dynamics","date":"2020-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JohnKurian/R2D2","path":"code/model/agent.py","file_url":"https://github.com/JohnKurian/R2D2/blob/HEAD/code/model/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"1ca43d242ae5f22c","mcp_get_code":{"code_sha256":"1ca43d242ae5f22c"}},{"arxiv_id":"1810.12894","paper":"/paper/exploration-by-random-network-distillation","title":"Exploration by Random Network Distillation","date":"2018-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jhare96/reinforcement-learning","path":"rlib/RND/model.py","file_url":"https://github.com/jhare96/reinforcement-learning/blob/HEAD/rlib/RND/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d1f045c24bd9b2b9","mcp_get_code":{"code_sha256":"d1f045c24bd9b2b9"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning","path":"src/agents.py","file_url":"https://github.com/MatthieuSarkis/Portfolio-Optimization-and-Goal-Based-Investment-with-Reinforcement-Learning/blob/HEAD/src/agents.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b0e759b2d521e146","mcp_get_code":{"code_sha256":"b0e759b2d521e146"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"BY571/Soft-Actor-Critic-and-Extensions","path":"files/Agent.py","file_url":"https://github.com/BY571/Soft-Actor-Critic-and-Extensions/blob/HEAD/files/Agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2ae117303c9ac594","mcp_get_code":{"code_sha256":"2ae117303c9ac594"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thomashirtz/soft-actor-critic","path":"soft_actor_critic/agent.py","file_url":"https://github.com/thomashirtz/soft-actor-critic/blob/HEAD/soft_actor_critic/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"05437b66f08eb4d6","mcp_get_code":{"code_sha256":"05437b66f08eb4d6"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/PPO-Reacher_UnityML","path":"agent.py","file_url":"https://github.com/bonniesjli/PPO-Reacher_UnityML/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b1f30e180cb81a3a","mcp_get_code":{"code_sha256":"b1f30e180cb81a3a"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/PPO_Reacher","path":"agent.py","file_url":"https://github.com/bonniesjli/PPO_Reacher/blob/HEAD/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4c40cb5849fd342f","mcp_get_code":{"code_sha256":"4c40cb5849fd342f"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"PPO/PPO_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/PPO/PPO_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"53db83baee745ffd","mcp_get_code":{"code_sha256":"53db83baee745ffd"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nric/ProximalPolicyOptimizationContinuousKeras","path":"ppo_keras_continuous.py","file_url":"https://github.com/nric/ProximalPolicyOptimizationContinuousKeras/blob/HEAD/ppo_keras_continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f473685be4b59e7f","mcp_get_code":{"code_sha256":"f473685be4b59e7f"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mit-realm/neuriss","path":"neuriss/rl/ppo.py","file_url":"https://github.com/mit-realm/neuriss/blob/HEAD/neuriss/rl/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c3c2c245443da6e3","mcp_get_code":{"code_sha256":"c3c2c245443da6e3"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xtma/simple-pytorch-rl","path":"ppo.py","file_url":"https://github.com/xtma/simple-pytorch-rl/blob/HEAD/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"64930ee88e057fb9","mcp_get_code":{"code_sha256":"64930ee88e057fb9"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jhare96/reinforcement-learning","path":"rlib/PPO/model.py","file_url":"https://github.com/jhare96/reinforcement-learning/blob/HEAD/rlib/PPO/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"449ad938cfccea32","mcp_get_code":{"code_sha256":"449ad938cfccea32"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alexbaumi/PPO-Algorithm","path":"Agent.py","file_url":"https://github.com/alexbaumi/PPO-Algorithm/blob/HEAD/Agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d196dcee4a5b1061","mcp_get_code":{"code_sha256":"d196dcee4a5b1061"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"philtabor/Multi-Agent-Deep-Deterministic-Policy-Gradients","path":"maddpg.py","file_url":"https://github.com/philtabor/Multi-Agent-Deep-Deterministic-Policy-Gradients/blob/HEAD/maddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6e3b52a2c0014b70","mcp_get_code":{"code_sha256":"6e3b52a2c0014b70"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MrDaubinet/collaboration-and-competition","path":"maddpg.py","file_url":"https://github.com/MrDaubinet/collaboration-and-competition/blob/HEAD/maddpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5d2d3b9ff319eb0d","mcp_get_code":{"code_sha256":"5d2d3b9ff319eb0d"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baradist/multiagent-particle-envs","path":"multiagent/ddpg/ddpg_agent.py","file_url":"https://github.com/baradist/multiagent-particle-envs/blob/HEAD/multiagent/ddpg/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f3e14c78a36f2168","mcp_get_code":{"code_sha256":"f3e14c78a36f2168"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity","path":"multiagent_resources.py","file_url":"https://github.com/petsol/MultiAgentCooperation_UnityAgent_MADDPG_Udacity/blob/HEAD/multiagent_resources.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a35198f4b2a98333","mcp_get_code":{"code_sha256":"a35198f4b2a98333"}},{"arxiv_id":"1706.02275","paper":"/paper/multi-agent-actor-critic-for-mixed","title":"Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments","date":"2017-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bonniesjli/MADDPG_Tennis_UnityML","path":"MADDPG.py","file_url":"https://github.com/bonniesjli/MADDPG_Tennis_UnityML/blob/HEAD/MADDPG.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c455aad4cf9e3d68","mcp_get_code":{"code_sha256":"c455aad4cf9e3d68"}},{"arxiv_id":"1611.02779","paper":"/paper/rl2-fast-reinforcement-learning-via-slow","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","date":"2016-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aliengirlliv/teachable","path":"algos/ppo.py","file_url":"https://github.com/aliengirlliv/teachable/blob/HEAD/algos/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0a776339f3429848","mcp_get_code":{"code_sha256":"0a776339f3429848"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Nasdin/ReinforcementLearning-AtariGame","path":"reinforcement_learninga3c/agent.py","file_url":"https://github.com/Nasdin/ReinforcementLearning-AtariGame/blob/HEAD/reinforcement_learninga3c/agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"470157876533fcf9","mcp_get_code":{"code_sha256":"470157876533fcf9"}},{"arxiv_id":"1602.01783","paper":"/paper/asynchronous-methods-for-deep-reinforcement","title":"Asynchronous Methods for Deep Reinforcement Learning","date":"2016-02-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Remtasya/DDPG-Actor-Critic-Reinforcement-Learning-Reacher-Environment","path":"ddpg_agent.py","file_url":"https://github.com/Remtasya/DDPG-Actor-Critic-Reinforcement-Learning-Reacher-Environment/blob/HEAD/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c4712162b51f3c2d","mcp_get_code":{"code_sha256":"c4712162b51f3c2d"}},{"arxiv_id":"1511.05952","paper":"/paper/prioritized-experience-replay","title":"Prioritized Experience Replay","date":"2015-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cocolico14/N-step-Dueling-DDQN-PER-Pacman","path":"agent.py","file_url":"https://github.com/cocolico14/N-step-Dueling-DDQN-PER-Pacman/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7301cd0334b1ec18","mcp_get_code":{"code_sha256":"7301cd0334b1ec18"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seacevedo/ReinforcementLearningProjects","path":"ddqn.py","file_url":"https://github.com/seacevedo/ReinforcementLearningProjects/blob/HEAD/ddqn.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5f8524dc2a2cab41","mcp_get_code":{"code_sha256":"5f8524dc2a2cab41"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Adrelf/DRL-navigation","path":"brain/dqn_agent.py","file_url":"https://github.com/Adrelf/DRL-navigation/blob/HEAD/brain/dqn_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3836a1d32ca55617","mcp_get_code":{"code_sha256":"3836a1d32ca55617"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"1jsingh/rl_navigation","path":"agents/dqn_agent.py","file_url":"https://github.com/1jsingh/rl_navigation/blob/HEAD/agents/dqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f370c556306eb621","mcp_get_code":{"code_sha256":"f370c556306eb621"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kmdanielduan/DQN_Family_PyTorch","path":"agent.py","file_url":"https://github.com/kmdanielduan/DQN_Family_PyTorch/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"1324ea2444e296ba","mcp_get_code":{"code_sha256":"1324ea2444e296ba"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DoubleDQN/DoubleDQN_Discrete.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DoubleDQN/DoubleDQN_Discrete.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"684dac16bf6352e6","mcp_get_code":{"code_sha256":"684dac16bf6352e6"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PeterJochem/Deep_RL","path":"DDQN/BBreaker/myAgent.py","file_url":"https://github.com/PeterJochem/Deep_RL/blob/HEAD/DDQN/BBreaker/myAgent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a812e436e77634de","mcp_get_code":{"code_sha256":"a812e436e77634de"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"utarumo/RL_implementation","path":"dqn_atari.py","file_url":"https://github.com/utarumo/RL_implementation/blob/HEAD/dqn_atari.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"1f87bb3ad2308635","mcp_get_code":{"code_sha256":"1f87bb3ad2308635"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shehrum/RL_Navigation","path":"dqn_agent.py","file_url":"https://github.com/shehrum/RL_Navigation/blob/HEAD/dqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d258022cfdb2a560","mcp_get_code":{"code_sha256":"d258022cfdb2a560"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HussonnoisMaxence/RL_Algorithms","path":"QLearning/D2QN/D2QN.py","file_url":"https://github.com/HussonnoisMaxence/RL_Algorithms/blob/HEAD/QLearning/D2QN/D2QN.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7802ec0bd30c8512","mcp_get_code":{"code_sha256":"7802ec0bd30c8512"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tkcoding/DeepRL","path":"Banana_Navigator/Agent.py","file_url":"https://github.com/tkcoding/DeepRL/blob/HEAD/Banana_Navigator/Agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"59b97ac055efa363","mcp_get_code":{"code_sha256":"59b97ac055efa363"}},{"arxiv_id":"1509.06461","paper":"/paper/deep-reinforcement-learning-with-double-q","title":"Deep Reinforcement Learning with Double Q-learning","date":"2015-09-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NikolausBerl/Udacity_DRLN_Navigation_Project","path":"dqn_agent.py","file_url":"https://github.com/NikolausBerl/Udacity_DRLN_Navigation_Project/blob/HEAD/dqn_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"52999846a5c49f96","mcp_get_code":{"code_sha256":"52999846a5c49f96"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xtma/simple-pytorch-rl","path":"ddpg.py","file_url":"https://github.com/xtma/simple-pytorch-rl/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7167793e1651d552","mcp_get_code":{"code_sha256":"7167793e1651d552"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"b06b01073/continuous-control","path":"ddpg.py","file_url":"https://github.com/b06b01073/continuous-control/blob/HEAD/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b5564eaf87a00dd7","mcp_get_code":{"code_sha256":"b5564eaf87a00dd7"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dfki-ric-underactuated-lab/torque_limited_simple_pendulum","path":"software/python/simple_pendulum/reinforcement_learning/ddpg/ddpg.py","file_url":"https://github.com/dfki-ric-underactuated-lab/torque_limited_simple_pendulum/blob/HEAD/software/python/simple_pendulum/reinforcement_learning/ddpg/ddpg.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"d7979806fed71eee","mcp_get_code":{"code_sha256":"d7979806fed71eee"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"claudeHifly/BipedalWalker-v3","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/claudeHifly/BipedalWalker-v3/blob/HEAD/DDPG/ddpg_agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"584aca50891286f5","mcp_get_code":{"code_sha256":"584aca50891286f5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fshamshirdar/pytorch-rdpg","path":"rdpg.py","file_url":"https://github.com/fshamshirdar/pytorch-rdpg/blob/HEAD/rdpg.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f21df3758ed39418","mcp_get_code":{"code_sha256":"f21df3758ed39418"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Crevass/Hybrid-Agent","path":"agent.py","file_url":"https://github.com/Crevass/Hybrid-Agent/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"40c191818d46c0c5","mcp_get_code":{"code_sha256":"40c191818d46c0c5"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient","path":"ddpg_agent.py","file_url":"https://github.com/iDataist/Continuous-Control-with-Deep-Deterministic-Policy-Gradient/blob/HEAD/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"beb77bbddb9714ae","mcp_get_code":{"code_sha256":"beb77bbddb9714ae"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env","path":"ddpg_agent.py","file_url":"https://github.com/IvanVigor/Deep-Deterministic-Policy-Gradient-Unity-Env/blob/HEAD/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"8950c65039fc4fe3","mcp_get_code":{"code_sha256":"8950c65039fc4fe3"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"PeterJochem/Deep_RL","path":"DDPG/pendulum/myAgent_pendulum.py","file_url":"https://github.com/PeterJochem/Deep_RL/blob/HEAD/DDPG/pendulum/myAgent_pendulum.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"684ee98628f58937","mcp_get_code":{"code_sha256":"684ee98628f58937"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZainRaza14/deepRL","path":"DDPG/ddpg_agent.py","file_url":"https://github.com/ZainRaza14/deepRL/blob/HEAD/DDPG/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"caf348a3362776fb","mcp_get_code":{"code_sha256":"caf348a3362776fb"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"madhur-tandon/RL-Project","path":"agent.py","file_url":"https://github.com/madhur-tandon/RL-Project/blob/HEAD/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"661322009d0d9169","mcp_get_code":{"code_sha256":"661322009d0d9169"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"biemann/Continuous-Control","path":"ddpg_agent.py","file_url":"https://github.com/biemann/Continuous-Control/blob/HEAD/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"364b3433ab267478","mcp_get_code":{"code_sha256":"364b3433ab267478"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"T3chy/DDPG","path":"ddpg_torch.py","file_url":"https://github.com/T3chy/DDPG/blob/HEAD/ddpg_torch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"513584b85fd46561","mcp_get_code":{"code_sha256":"513584b85fd46561"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"marload/DeepRL-TensorFlow2","path":"DDPG/DDPG_Continuous.py","file_url":"https://github.com/marload/DeepRL-TensorFlow2/blob/HEAD/DDPG/DDPG_Continuous.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f3ea6018cdcc0b04","mcp_get_code":{"code_sha256":"f3ea6018cdcc0b04"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shehrum/RL_Continous-Control","path":"ddpg_agent.py","file_url":"https://github.com/shehrum/RL_Continous-Control/blob/HEAD/ddpg_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2216995588e06169","mcp_get_code":{"code_sha256":"2216995588e06169"}}]}