{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/create-stats-ordered-dict","entry":"create_stats_ordered_dict","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":25,"n_papers_ran":25,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":4,"n_samples_ran":4,"n_samples_fingerprinted":1,"n_places":26,"n_places_pointer_only":6,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":1,"ran":3,"unverified":0},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"familyld/SCORE","path":"score/SCORE.py","file_url":"https://github.com/familyld/SCORE/blob/HEAD/score/SCORE.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"32636b59623728e6","mcp_get_code":{"code_sha256":"32636b59623728e6"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"aviralkumar2907/CQL","path":"d4rl/rlkit/core/eval_util.py","file_url":"https://github.com/aviralkumar2907/CQL/blob/HEAD/d4rl/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2605.14779","paper":"/paper/arxiv-2605-14779","title":"PENG'S Q(λ) FOR CONSERVATIVE VALUE ESTIMATION IN OFFLINE REINFORCEMENT LEARNING","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"hyeon1996/EPQ","path":"rlkit/core/eval_util.py","file_url":"https://github.com/hyeon1996/EPQ/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2507.08387","paper":null,"title":"arXiv:2507.08387","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"shlee94/Off2OnRL","path":"rlkit/rlkit/core/eval_util.py","file_url":"https://github.com/shlee94/Off2OnRL/blob/HEAD/rlkit/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2502.03752","paper":"/paper/prism-a-robust-framework-for-skill-based-meta","title":"PRISM: A Robust Framework for Skill-based Meta-Reinforcement Learning with Noisy Demonstrations","date":"2025-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"katerakelly/oyster","path":"rlkit/core/eval_util.py","file_url":"https://github.com/katerakelly/oyster/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f395bfda2e4813d7","mcp_get_code":{"code_sha256":"f395bfda2e4813d7"}},{"arxiv_id":"2402.02017","paper":"/paper/value-aided-conditional-supervised-learning","title":"Adaptive $Q$-Aid for Conditional Supervised Learning in Offline Reinforcement Learning","date":"2024-02-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rail-berkeley/rlkit","path":"rlkit/core/eval_util.py","file_url":"https://github.com/rail-berkeley/rlkit/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2312.06348","paper":"/paper/diffail-diffusion-adversarial-imitation","title":"DiffAIL: Diffusion Adversarial Imitation Learning","date":"2023-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-group-sdu/diffail","path":"rlkit/core/eval_util.py","file_url":"https://github.com/ml-group-sdu/diffail/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"74f5c8625fad7bbc","mcp_get_code":{"code_sha256":"74f5c8625fad7bbc"}},{"arxiv_id":"2311.05067","paper":"/paper/accelerating-exploration-with-unlabeled-prior-1","title":"Accelerating Exploration with Unlabeled Prior Data","date":"2023-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"avisingh599/cog","path":"rlkit/core/eval_util.py","file_url":"https://github.com/avisingh599/cog/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2311.03695","paper":"/paper/context-shift-reduction-for-offline-meta-1","title":"Context Shift Reduction for Offline Meta-Reinforcement Learning","date":"2023-11-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"moreanp/csro","path":"rlkit/core/eval_util.py","file_url":"https://github.com/moreanp/csro/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f395bfda2e4813d7","mcp_get_code":{"code_sha256":"f395bfda2e4813d7"}},{"arxiv_id":"2310.19424","paper":"/paper/variational-curriculum-reinforcement-learning","title":"Variational Curriculum Reinforcement Learning for Unsupervised Discovery of Skills","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seongun-kim/vcrl","path":"vcrl/core/eval_util.py","file_url":"https://github.com/seongun-kim/vcrl/blob/HEAD/vcrl/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2307.05891","paper":"/paper/pid-inspired-inductive-biases-for-deep-1","title":"PID-Inspired Inductive Biases for Deep Reinforcement Learning in Partially Observable Control Tasks","date":"2023-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IanChar/GPIDE","path":"rlkit/core/eval_util.py","file_url":"https://github.com/IanChar/GPIDE/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2306.03346","paper":"/paper/stabilizing-contrastive-rl-techniques-for","title":"Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data","date":"2023-06-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"chongyi-zheng/stable_contrastive_rl","path":"rlkit/core/eval_util.py","file_url":"https://github.com/chongyi-zheng/stable_contrastive_rl/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2305.19746","paper":"/paper/adaptive-and-explainable-deployment-of","title":"Adaptive and Explainable Deployment of Navigation Skills via Hierarchical Deep Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2023-05","title_source":"archive","repo":"leekwoon/hrl-nav","path":"src/rlkit/core/eval_util.py","file_url":"https://github.com/leekwoon/hrl-nav/blob/HEAD/src/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2212.13936","paper":"/paper/on-pathologies-in-kl-regularized-1","title":"On Pathologies in KL-Regularized Reinforcement Learning from Expert Demonstrations","date":"2022-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"conglu1997/nppac","path":"rlkit/core/eval_util.py","file_url":"https://github.com/conglu1997/nppac/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2209.15256","paper":"/paper/s2p-state-conditioned-image-synthesis-for","title":"S2P: State-conditioned Image Synthesis for Data Augmentation in Offline Reinforcement Learning","date":"2022-09-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dsshim0125/s2p","path":"rlkit/core/eval_util.py","file_url":"https://github.com/dsshim0125/s2p/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2206.04745","paper":"/paper/mildly-conservative-q-learning-for-offline","title":"Mildly Conservative Q-Learning for Offline Reinforcement Learning","date":"2022-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vitchyr/rlkit","path":"rlkit/core/eval_util.py","file_url":"https://github.com/vitchyr/rlkit/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2206.03023","paper":"/paper/how-far-i-ll-go-offline-goal-conditioned","title":"How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression","date":"2022-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jasonma2016/gofar","path":"envs/env_util.py","file_url":"https://github.com/jasonma2016/gofar/blob/HEAD/envs/env_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f395bfda2e4813d7","mcp_get_code":{"code_sha256":"f395bfda2e4813d7"}},{"arxiv_id":"2205.13697","paper":"/paper/fedformer-contextual-federation-with","title":"FedFormer: Contextual Federation with Attention in Reinforcement Learning","date":"2022-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liamhebert/FedFormer","path":"rlkit/core/eval_util.py","file_url":"https://github.com/liamhebert/FedFormer/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2106.00671","paper":"/paper/what-can-i-do-here-learning-new-skills-by","title":"What Can I Do Here? Learning New Skills by Imagining Visual Affordances","date":"2021-06-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"patrickhaoy/ptp","path":"rlkit/core/eval_util.py","file_url":"https://github.com/patrickhaoy/ptp/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2104.09122","paper":"/paper/probabilistic-mixture-of-experts-for-1","title":"Probabilistic Mixture-of-Experts for Efficient Deep Reinforcement Learning","date":"2021-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JieRen98/rlkit-pmoe","path":"rlkit/core/eval_util.py","file_url":"https://github.com/JieRen98/rlkit-pmoe/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2010.08252","paper":"/paper/hyperparameter-auto-tuning-in-self-supervised","title":"Hyperparameter Auto-tuning in Self-Supervised Robotic Learning","date":"2020-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"birlrobotics/rlkit_autotune","path":"rlkit/core/eval_util.py","file_url":"https://github.com/birlrobotics/rlkit_autotune/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2006.13916","paper":"/paper/off-dynamics-reinforcement-learning-training","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","date":"2020-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shreyasc-13/off_domain_rlkit","path":"rlkit/core/eval_util.py","file_url":"https://github.com/shreyasc-13/off_domain_rlkit/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"2006.04779","paper":"/paper/conservative-q-learning-for-offline","title":"Conservative Q-Learning for Offline Reinforcement Learning","date":"2020-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ikostrikov/cql-results","path":"d4rl/rlkit/core/eval_util.py","file_url":"https://github.com/ikostrikov/cql-results/blob/HEAD/d4rl/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"1912.11032","paper":"/paper/towards-practical-multi-object-manipulation","title":"Towards Practical Multi-Object Manipulation using Relational Reinforcement Learning","date":"2019-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"richardrl/rlkit-relational","path":"rlkit/core/eval_util.py","file_url":"https://github.com/richardrl/rlkit-relational/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f395bfda2e4813d7","mcp_get_code":{"code_sha256":"f395bfda2e4813d7"}},{"arxiv_id":"1910.11670","paper":"/paper/contextual-imagined-goals-for-self-supervised","title":"Contextual Imagined Goals for Self-Supervised Robotic Learning","date":"2019-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anair13/rlkit","path":"rlkit/core/eval_util.py","file_url":"https://github.com/anair13/rlkit/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fadf5f762ff04cd6","mcp_get_code":{"code_sha256":"fadf5f762ff04cd6"}},{"arxiv_id":"1903.08254","paper":"/paper/efficient-off-policy-meta-reinforcement","title":"Efficient Off-Policy Meta-Reinforcement Learning via Probabilistic Context Variables","date":"2019-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lujiayou123/Off-Policy-Meta-Reinforcement-Learning-via-Unsupervised-Domain-Translation","path":"rlkit/core/eval_util.py","file_url":"https://github.com/lujiayou123/Off-Policy-Meta-Reinforcement-Learning-via-Unsupervised-Domain-Translation/blob/HEAD/rlkit/core/eval_util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f395bfda2e4813d7","mcp_get_code":{"code_sha256":"f395bfda2e4813d7"}}]}