{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/select-action","entry":"select_action","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":22,"n_papers_ran":7,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":20,"n_samples_ran":5,"n_samples_fingerprinted":0,"n_places":24,"n_places_pointer_only":8,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":3,"ran":2,"unverified":15},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.20832","paper":"/paper/arxiv-2606-20832","title":"ReLaTS: a Reinforcement Learning-based method for dynamically determining the coupling Time Step in multi-scale simulations of self-gravitating systems","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"veronicasaz/RL_bridgedCluster","path":"TrainRL.py","file_url":"https://github.com/veronicasaz/RL_bridgedCluster/blob/HEAD/TrainRL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0d01e6f28ed555ed","mcp_get_code":{"code_sha256":"0d01e6f28ed555ed"}},{"arxiv_id":"2503.00778","paper":"/paper/affordgrasp-in-context-affordance-reasoning","title":"AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter","date":null,"month_inferred_from_arxiv_id":"2025-03","title_source":"archive","repo":"H-Freax/ThinkGrasp","path":"realarm.py","file_url":"https://github.com/H-Freax/ThinkGrasp/blob/HEAD/realarm.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ae08b081b5d182e6","mcp_get_code":{"code_sha256":"ae08b081b5d182e6"}},{"arxiv_id":"2405.04342","paper":"/paper/the-curse-of-diversity-in-ensemble-based","title":"The Curse of Diversity in Ensemble-Based Exploration","date":"2024-05-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhixuan-lin/ensemble-rl-discrete","path":"ensemble_rl/agents/boot_quantile_agent.py","file_url":"https://github.com/zhixuan-lin/ensemble-rl-discrete/blob/HEAD/ensemble_rl/agents/boot_quantile_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5eff8223ef2a7296","mcp_get_code":{"code_sha256":"5eff8223ef2a7296"}},{"arxiv_id":"2404.05440","paper":"/paper/tree-search-based-policy-optimization-under","title":"Tree Search-Based Policy Optimization under Stochastic Execution Delay","date":"2024-04-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"davidva1/Delayed-EZ","path":"core/utils.py","file_url":"https://github.com/davidva1/Delayed-EZ/blob/HEAD/core/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"7cf8a53360f599af","mcp_get_code":{"code_sha256":"7cf8a53360f599af"}},{"arxiv_id":"2310.10833","paper":"/paper/proper-laplacian-representation-learning","title":"Proper Laplacian Representation Learning","date":"2023-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"2957ca0c26f2fc3f","mcp_get_code":{"code_sha256":"2957ca0c26f2fc3f"}},{"arxiv_id":"2304.13571","paper":"/paper/quantum-natural-policy-gradients-towards","title":"Quantum Natural Policy Gradients: Towards Sample-Efficient Reinforcement Learning","date":"2023-04-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicomeyer96/quantum-natural-policy-gradients","path":"utils.py","file_url":"https://github.com/nicomeyer96/quantum-natural-policy-gradients/blob/HEAD/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"720b07b98b308694","mcp_get_code":{"code_sha256":"720b07b98b308694"}},{"arxiv_id":"2301.11181","paper":"/paper/deep-laplacian-based-options-for-temporally","title":"Deep Laplacian-based Options for Temporally-Extended Exploration","date":"2023-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"2957ca0c26f2fc3f","mcp_get_code":{"code_sha256":"2957ca0c26f2fc3f"}},{"arxiv_id":"2212.02098","paper":"/paper/a-machine-with-short-term-episodic-and","title":"A Machine with Short-Term, Episodic, and Semantic Memory Systems","date":"2022-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"humemai/agent-room-env-v1","path":"agent/dqn/utils.py","file_url":"https://github.com/humemai/agent-room-env-v1/blob/HEAD/agent/dqn/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"750debd5365bc34e","mcp_get_code":{"code_sha256":"750debd5365bc34e"}},{"arxiv_id":"2212.02098","paper":"/paper/a-machine-with-short-term-episodic-and","title":"A Machine with Short-Term, Episodic, and Semantic Memory Systems","date":"2022-12-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"humemai/agent-room-env-v1","path":"agent/ppo/utils.py","file_url":"https://github.com/humemai/agent-room-env-v1/blob/HEAD/agent/ppo/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8ee60ab856ea7100","mcp_get_code":{"code_sha256":"8ee60ab856ea7100"}},{"arxiv_id":"2210.10763","paper":"/paper/on-the-feasibility-of-cross-task-transfer","title":"On the Feasibility of Cross-Task Transfer with Model-Based Reinforcement Learning","date":"2022-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlpc-ucsd/xtra","path":"src/core/utils.py","file_url":"https://github.com/mlpc-ucsd/xtra/blob/HEAD/src/core/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f20a0c2687734ea6","mcp_get_code":{"code_sha256":"f20a0c2687734ea6"}},{"arxiv_id":"2108.11939","paper":"/paper/understanding-and-accelerating-neural","title":"Understanding and Accelerating Neural Architecture Search with Training-Free and Theory-Grounded Metrics","date":"2021-08-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vita-group/tegnas","path":"reinforce.py","file_url":"https://github.com/vita-group/tegnas/blob/HEAD/reinforce.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d76fd75b329eb07e","mcp_get_code":{"code_sha256":"d76fd75b329eb07e"}},{"arxiv_id":"2107.00860","paper":"/paper/rapid-neural-architecture-search-by-learning-1","title":"Rapid Neural Architecture Search by Learning to Generate Graphs from Datasets","date":"2021-07-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"D-X-Y/AutoDL-Projects","path":"exps/NAS-Bench-201-algos/reinforce.py","file_url":"https://github.com/D-X-Y/AutoDL-Projects/blob/HEAD/exps/NAS-Bench-201-algos/reinforce.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0e6f925ca93551fa","mcp_get_code":{"code_sha256":"0e6f925ca93551fa"}},{"arxiv_id":"2106.02193","paper":"/paper/cross-trajectory-representation-learning-for","title":"Cross-Trajectory Representation Learning for Zero-Shot Generalization in RL","date":"2021-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bmazoure/ctrl_public","path":"algo.py","file_url":"https://github.com/bmazoure/ctrl_public/blob/HEAD/algo.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2ed07b9462bf332f","mcp_get_code":{"code_sha256":"2ed07b9462bf332f"}},{"arxiv_id":"2007.09445","paper":"/paper/structure-mapping-for-transferability-of","title":"Structure Mapping for Transferability of Causal Models","date":"2020-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Information-Fusion-Lab-Umass/causal_transfer_learning","path":"codes/models/rl_approaches/DQN_main.py","file_url":"https://github.com/Information-Fusion-Lab-Umass/causal_transfer_learning/blob/HEAD/codes/models/rl_approaches/DQN_main.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bb75366f778f682d","mcp_get_code":{"code_sha256":"bb75366f778f682d"}},{"arxiv_id":"2002.08376","paper":"/paper/a-differentiable-programming-method-for","title":"A differentiable programming method for quantum control","date":null,"month_inferred_from_arxiv_id":"2020-02","title_source":"archive","repo":"frankschae/A-differentiable-programming-method-for-quantum-control","path":"qubit/reinforce/policy_gradient_qubit.py","file_url":"https://github.com/frankschae/A-differentiable-programming-method-for-quantum-control/blob/HEAD/qubit/reinforce/policy_gradient_qubit.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e35734bfb6c1e4ee","mcp_get_code":{"code_sha256":"e35734bfb6c1e4ee"}},{"arxiv_id":"2001.00326","paper":"/paper/nas-bench-102-extending-the-scope-of","title":"NAS-Bench-201: Extending the Scope of Reproducible Neural Architecture Search","date":"2020-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"D-X-Y/NAS-Projects","path":"exps/NAS-Bench-201-algos/reinforce.py","file_url":"https://github.com/D-X-Y/NAS-Projects/blob/HEAD/exps/NAS-Bench-201-algos/reinforce.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0e6f925ca93551fa","mcp_get_code":{"code_sha256":"0e6f925ca93551fa"}},{"arxiv_id":"2001.00326","paper":"/paper/nas-bench-102-extending-the-scope-of","title":"NAS-Bench-201: Extending the Scope of Reproducible Neural Architecture Search","date":"2020-01-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yoichii/nashpobench2api","path":"bench_algos/reinforce.py","file_url":"https://github.com/yoichii/nashpobench2api/blob/HEAD/bench_algos/reinforce.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0aaac10bb2675319","mcp_get_code":{"code_sha256":"0aaac10bb2675319"}},{"arxiv_id":"1911.08265","paper":"/paper/mastering-atari-go-chess-and-shogi-by","title":"Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model","date":"2019-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dmiracle/muzero-starter","path":"pseudocode.py","file_url":"https://github.com/dmiracle/muzero-starter/blob/HEAD/pseudocode.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fe46ed855a1faead","mcp_get_code":{"code_sha256":"fe46ed855a1faead"}},{"arxiv_id":"1902.02441","paper":"/paper/artificial-intelligence-for-prosthetics","title":"Artificial Intelligence for Prosthetics - challenge solutions","date":"2019-02-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iasawseen/MultiServerRL","path":"simple_virtual_env/client.py","file_url":"https://github.com/iasawseen/MultiServerRL/blob/HEAD/simple_virtual_env/client.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"17277a43a521c152","mcp_get_code":{"code_sha256":"17277a43a521c152"}},{"arxiv_id":"1812.09755","paper":"/paper/learning-when-to-communicate-at-scale-in","title":"Learning when to Communicate at Scale in Multiagent Cooperative and Competitive Tasks","date":"2018-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IC3Net/IC3Net","path":"action_utils.py","file_url":"https://github.com/IC3Net/IC3Net/blob/HEAD/action_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"dbf148c04f6bc762","mcp_get_code":{"code_sha256":"dbf148c04f6bc762"}},{"arxiv_id":"1812.06110","paper":"/paper/dopamine-a-research-framework-for-deep","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","date":"2018-12-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"google/dopamine","path":"dopamine/jax/agents/rainbow/rainbow_agent.py","file_url":"https://github.com/google/dopamine/blob/HEAD/dopamine/jax/agents/rainbow/rainbow_agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e71ad53b0a330121","mcp_get_code":{"code_sha256":"e71ad53b0a330121"}},{"arxiv_id":"1810.06339","paper":"/paper/deep-reinforcement-learning","title":"Deep Reinforcement Learning","date":"2018-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"e71ad53b0a330121","mcp_get_code":{"code_sha256":"e71ad53b0a330121"}},{"arxiv_id":"1805.09044","paper":"/paper/representation-balancing-mdps-for-off-policy","title":"Representation Balancing MDPs for Off-Policy Policy Evaluation","date":"2018-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"stanfordai4hi/repbm","path":"qlearning_cartpole.py","file_url":"https://github.com/stanfordai4hi/repbm/blob/HEAD/qlearning_cartpole.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a1999e91696fab13","mcp_get_code":{"code_sha256":"a1999e91696fab13"}},{"arxiv_id":"1710.11089","paper":"/paper/eigenoption-discovery-through-the-deep","title":"Eigenoption Discovery through the Deep Successor Representation","date":"2017-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mklissa/dceo","path":"dopamine/jax/agents/full_rainbow/full_rainbow_dceo.py","file_url":"https://github.com/mklissa/dceo/blob/HEAD/dopamine/jax/agents/full_rainbow/full_rainbow_dceo.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2957ca0c26f2fc3f","mcp_get_code":{"code_sha256":"2957ca0c26f2fc3f"}}]}