{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/policy","entry":"Policy","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":23,"n_papers_ran":12,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":26,"n_samples_ran":15,"n_samples_fingerprinted":7,"n_places":26,"n_places_pointer_only":10,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":15,"unverified":11},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2606.10187","paper":"/paper/arxiv-2606-10187","title":"Decision-Calibrated Conformal Uncertainty for Pacing Decisions in Streaming Advertising","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"p-shekhar/pacing-decisions-advertising","path":"src/pacing.py","file_url":"https://github.com/p-shekhar/pacing-decisions-advertising/blob/HEAD/src/pacing.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4f0d15e65ff0dada","mcp_get_code":{"code_sha256":"4f0d15e65ff0dada"}},{"arxiv_id":"2605.24862","paper":"/paper/arxiv-2605-24862","title":"Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"zq2r/V2A","path":"algo/offline_offline/v2a_igdf.py","file_url":"https://github.com/zq2r/V2A/blob/HEAD/algo/offline_offline/v2a_igdf.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"17fe358051cb051d","mcp_get_code":{"code_sha256":"17fe358051cb051d"}},{"arxiv_id":"2605.13054","paper":"/paper/arxiv-2605-13054","title":"Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"dmksjfl/OTDF","path":"algo/OTDF.py","file_url":"https://github.com/dmksjfl/OTDF/blob/HEAD/algo/OTDF.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"de82e16ed1f96d63","mcp_get_code":{"code_sha256":"de82e16ed1f96d63"}},{"arxiv_id":"2605.11711","paper":"/paper/arxiv-2605-11711","title":"Debiased Model-based Representations for Sample-efficient Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"dmksjfl/DR.Q","path":"DRQ/DRQ.py","file_url":"https://github.com/dmksjfl/DR.Q/blob/HEAD/DRQ/DRQ.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"63154df49f509367","mcp_get_code":{"code_sha256":"63154df49f509367"}},{"arxiv_id":"2512.02486","paper":"/paper/arxiv-2512-02486","title":"Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"zq2r/DROCO","path":"algo/offline_offline/droco.py","file_url":"https://github.com/zq2r/DROCO/blob/HEAD/algo/offline_offline/droco.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8a661ac1c9e4bfbf","mcp_get_code":{"code_sha256":"8a661ac1c9e4bfbf"}},{"arxiv_id":"2412.03258","paper":"/paper/learning-on-one-mode-addressing-multi","title":"Learning on One Mode: Addressing Multi-Modality in Offline Reinforcement Learning","date":"2024-12-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MianchuWang/LOM","path":"agents/lom.py","file_url":"https://github.com/MianchuWang/LOM/blob/HEAD/agents/lom.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"131334e831c564cd","mcp_get_code":{"code_sha256":"131334e831c564cd"}},{"arxiv_id":"2407.00695","paper":"/paper/learning-formal-mathematics-from-intrinsic","title":"Learning Formal Mathematics From Intrinsic Motivation","date":"2024-06-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gpoesia/minimo","path":"learning/proofsearch.py","file_url":"https://github.com/gpoesia/minimo/blob/HEAD/learning/proofsearch.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"125ede135fa4d524","mcp_get_code":{"code_sha256":"125ede135fa4d524"}},{"arxiv_id":"2405.15369","paper":"/paper/cross-domain-policy-adaptation-by-capturing","title":"Cross-Domain Policy Adaptation by Capturing Representation Mismatch","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dmksjfl/par","path":"algo/PAR.py","file_url":"https://github.com/dmksjfl/par/blob/HEAD/algo/PAR.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"410b5d459ab3fd2b","mcp_get_code":{"code_sha256":"410b5d459ab3fd2b"}},{"arxiv_id":"2404.15617","paper":"/paper/dpo-differential-reinforcement-learning-with","title":"DPO: A Differential and Pointwise Control Approach to Reinforcement Learning","date":"2024-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mpnguyen2/dfPO","path":"policy.py","file_url":"https://github.com/mpnguyen2/dfPO/blob/HEAD/policy.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6888d4461df5d507","mcp_get_code":{"code_sha256":"6888d4461df5d507"}},{"arxiv_id":"2305.18290","paper":"/paper/direct-preference-optimization-your-language","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","date":"2023-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sauc-abadal/alt","path":"alt/trainer/alt_trainer.py","file_url":"https://github.com/sauc-abadal/alt/blob/HEAD/alt/trainer/alt_trainer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0a800ad29eb472ac","mcp_get_code":{"code_sha256":"0a800ad29eb472ac"}},{"arxiv_id":"2305.15065","paper":"/paper/inference-time-policy-adapters-ipa-tailoring","title":"Inference-Time Policy Adapters (IPA): Tailoring Extreme-Scale LMs without Fine-tuning","date":"2023-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gximinglu/ipa","path":"policy.py","file_url":"https://github.com/gximinglu/ipa/blob/HEAD/policy.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"4e0ff675e558ddf8","mcp_get_code":{"code_sha256":"4e0ff675e558ddf8"}},{"arxiv_id":"2301.10230","paper":"/paper/double-matching-under-complementary","title":"Two-sided Competing Matching Recommendation Markets With Quota and Complementary Preferences Constraints","date":"2023-01-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"likelyt/double-matching","path":"code/MultiAgent.py","file_url":"https://github.com/likelyt/double-matching/blob/HEAD/code/MultiAgent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"da204097cd0b01b8","mcp_get_code":{"code_sha256":"da204097cd0b01b8"}},{"arxiv_id":"2210.07729","paper":"/paper/model-based-imitation-learning-for-urban","title":"Model-Based Imitation Learning for Urban Driving","date":"2022-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wayveai/mile","path":"mile/models/mile.py","file_url":"https://github.com/wayveai/mile/blob/HEAD/mile/models/mile.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"74e17dd6e4bbca2a","mcp_get_code":{"code_sha256":"74e17dd6e4bbca2a"}},{"arxiv_id":"2210.03078","paper":"/paper/rainier-reinforced-knowledge-introspector-for","title":"Rainier: Reinforced Knowledge Introspector for Commonsense Question Answering","date":"2022-10-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liujch1998/rainier","path":"rainier/ppo.py","file_url":"https://github.com/liujch1998/rainier/blob/HEAD/rainier/ppo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"af8e5334f66e1240","mcp_get_code":{"code_sha256":"af8e5334f66e1240"}},{"arxiv_id":"2206.03150","paper":"/paper/group-meritocratic-fairness-in-linear","title":"Group Meritocratic Fairness in Linear Contextual Bandits","date":"2022-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"csml-iit-ucl/gmfbandits","path":"policies.py","file_url":"https://github.com/csml-iit-ucl/gmfbandits/blob/HEAD/policies.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a0a343914e243cc8","mcp_get_code":{"code_sha256":"a0a343914e243cc8"}},{"arxiv_id":"2010.03768","paper":"/paper/alfworld-aligning-text-and-embodied","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","date":"2020-10-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alfworld/alfworld","path":"alfworld/agents/modules/model.py","file_url":"https://github.com/alfworld/alfworld/blob/HEAD/alfworld/agents/modules/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2ee19fbc662f9365","mcp_get_code":{"code_sha256":"2ee19fbc662f9365"}},{"arxiv_id":"2006.15212","paper":"/paper/hybrid-models-for-learning-to-branch","title":"Hybrid Models for Learning to Branch","date":"2020-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pg2455/hybrid-learn2branch","path":"models/film/model.py","file_url":"https://github.com/pg2455/hybrid-learn2branch/blob/HEAD/models/film/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2d9532467e473d7e","mcp_get_code":{"code_sha256":"2d9532467e473d7e"}},{"arxiv_id":"2004.01339","paper":"/paper/multi-agent-reinforcement-learning-for-2","title":"Multi-agent Reinforcement Learning for Networked System Control","date":"2020-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cts198859/deeprl_network","path":"agents/models.py","file_url":"https://github.com/cts198859/deeprl_network/blob/HEAD/agents/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"e9f4e2bdaca97b40","mcp_get_code":{"code_sha256":"e9f4e2bdaca97b40"}},{"arxiv_id":"1810.12894","paper":"/paper/exploration-by-random-network-distillation","title":"Exploration by Random Network Distillation","date":"2018-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"DuaneNielsen/rnd","path":"novelty_policy.py","file_url":"https://github.com/DuaneNielsen/rnd/blob/HEAD/novelty_policy.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"920f08f608d008cb","mcp_get_code":{"code_sha256":"920f08f608d008cb"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tuanpnm99/RLPongAgent","path":"Agent.py","file_url":"https://github.com/tuanpnm99/RLPongAgent/blob/HEAD/Agent.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c02c0631708465dc","mcp_get_code":{"code_sha256":"c02c0631708465dc"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mark-gluzman/NmodelPPO","path":"actor_utils.py","file_url":"https://github.com/mark-gluzman/NmodelPPO/blob/HEAD/actor_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ec594f35cdf2f00e","mcp_get_code":{"code_sha256":"ec594f35cdf2f00e"}},{"arxiv_id":"1707.06347","paper":"/paper/proximal-policy-optimization-algorithms","title":"Proximal Policy Optimization Algorithms","date":"2017-07-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ASzot/ppo-pytorch","path":"model.py","file_url":"https://github.com/ASzot/ppo-pytorch/blob/HEAD/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"be3a23c2176d855c","mcp_get_code":{"code_sha256":"be3a23c2176d855c"}},{"arxiv_id":"1703.03400","paper":"/paper/model-agnostic-meta-learning-for-fast","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","date":"2017-03-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Zhiwei-Z/SeqPromp","path":"meta_policy_search/meta_algos/base.py","file_url":"https://github.com/Zhiwei-Z/SeqPromp/blob/HEAD/meta_policy_search/meta_algos/base.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0630f74816818382","mcp_get_code":{"code_sha256":"0630f74816818382"}},{"arxiv_id":"1703.03400","paper":"/paper/model-agnostic-meta-learning-for-fast","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","date":"2017-03-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"clrrrr/promp_plus","path":"meta_policy_search/meta_algos/base.py","file_url":"https://github.com/clrrrr/promp_plus/blob/HEAD/meta_policy_search/meta_algos/base.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"93275e38a44a53ec","mcp_get_code":{"code_sha256":"93275e38a44a53ec"}},{"arxiv_id":"1509.02971","paper":"/paper/continuous-control-with-deep-reinforcement","title":"Continuous control with deep reinforcement learning","date":"2015-09-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"guillaumeboniface/reacher","path":"ddpg_controller.py","file_url":"https://github.com/guillaumeboniface/reacher/blob/HEAD/ddpg_controller.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"4e16ab1aa52fc01f","mcp_get_code":{"code_sha256":"4e16ab1aa52fc01f"}},{"arxiv_id":"1502.05477","paper":"/paper/trust-region-policy-optimization","title":"Trust Region Policy Optimization","date":"2015-02-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"magnusja/ppo","path":"src/policy.py","file_url":"https://github.com/magnusja/ppo/blob/HEAD/src/policy.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b11d0213b416df62","mcp_get_code":{"code_sha256":"b11d0213b416df62"}}]}