{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/simple-separated-format","entry":"simple_separated_format","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":28,"n_papers_ran":26,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":3,"n_samples_ran":1,"n_samples_fingerprinted":0,"n_places":28,"n_places_pointer_only":5,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":1,"unverified":2},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"aviralkumar2907/CQL","path":"d4rl/rlkit/core/tabulate.py","file_url":"https://github.com/aviralkumar2907/CQL/blob/HEAD/d4rl/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2605.14779","paper":"/paper/arxiv-2605-14779","title":"PENG'S Q(λ) FOR CONSERVATIVE VALUE ESTIMATION IN OFFLINE REINFORCEMENT LEARNING","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"hyeon1996/EPQ","path":"rlkit/core/tabulate.py","file_url":"https://github.com/hyeon1996/EPQ/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2507.08387","paper":null,"title":"arXiv:2507.08387","date":null,"month_inferred_from_arxiv_id":"2025-07","title_source":null,"repo":"shlee94/Off2OnRL","path":"rlkit/rlkit/core/tabulate.py","file_url":"https://github.com/shlee94/Off2OnRL/blob/HEAD/rlkit/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2502.03752","paper":"/paper/prism-a-robust-framework-for-skill-based-meta","title":"PRISM: A Robust Framework for Skill-based Meta-Reinforcement Learning with Noisy Demonstrations","date":"2025-02-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"katerakelly/oyster","path":"rlkit/core/tabulate.py","file_url":"https://github.com/katerakelly/oyster/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2411.11364","paper":"/paper/continual-task-learning-through-adaptive","title":"Continual Task Learning through Adaptive Policy Self-Composition","date":"2024-11-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"charleshsc/CompoFormer","path":"tabulate.py","file_url":"https://github.com/charleshsc/CompoFormer/blob/HEAD/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2411.01146","paper":"/paper/task-aware-harmony-multi-task-decision","title":"Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning","date":"2024-11-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"charleshsc/HarmoDT","path":"tabulate.py","file_url":"https://github.com/charleshsc/HarmoDT/blob/HEAD/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2405.17098","paper":"/paper/q-value-regularized-transformer-for-offline","title":"Q-value Regularized Transformer for Offline Reinforcement Learning","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"charleshsc/qt","path":"tabulate.py","file_url":"https://github.com/charleshsc/qt/blob/HEAD/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2402.02017","paper":"/paper/value-aided-conditional-supervised-learning","title":"Adaptive $Q$-Aid for Conditional Supervised Learning in Offline Reinforcement Learning","date":"2024-02-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rail-berkeley/rlkit","path":"rlkit/core/tabulate.py","file_url":"https://github.com/rail-berkeley/rlkit/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2401.02244","paper":"/paper/policy-regularized-offline-multi-objective","title":"Policy-regularized Offline Multi-objective Reinforcement Learning","date":"2024-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"qianlin04/prmorl","path":"lib/diffusion/tabulate.py","file_url":"https://github.com/qianlin04/prmorl/blob/HEAD/lib/diffusion/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2312.06348","paper":"/paper/diffail-diffusion-adversarial-imitation","title":"DiffAIL: Diffusion Adversarial Imitation Learning","date":"2023-12-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-group-sdu/diffail","path":"rlkit/core/tabulate.py","file_url":"https://github.com/ml-group-sdu/diffail/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2311.05067","paper":"/paper/accelerating-exploration-with-unlabeled-prior-1","title":"Accelerating Exploration with Unlabeled Prior Data","date":"2023-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"avisingh599/cog","path":"rlkit/core/tabulate.py","file_url":"https://github.com/avisingh599/cog/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2310.19424","paper":"/paper/variational-curriculum-reinforcement-learning","title":"Variational Curriculum Reinforcement Learning for Unsupervised Discovery of Skills","date":"2023-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seongun-kim/vcrl","path":"vcrl/core/tabulate.py","file_url":"https://github.com/seongun-kim/vcrl/blob/HEAD/vcrl/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2307.05891","paper":"/paper/pid-inspired-inductive-biases-for-deep-1","title":"PID-Inspired Inductive Biases for Deep Reinforcement Learning in Partially Observable Control Tasks","date":"2023-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"IanChar/GPIDE","path":"rlkit/core/tabulate.py","file_url":"https://github.com/IanChar/GPIDE/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2212.13936","paper":"/paper/on-pathologies-in-kl-regularized-1","title":"On Pathologies in KL-Regularized Reinforcement Learning from Expert Demonstrations","date":"2022-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"conglu1997/nppac","path":"rlkit/core/tabulate.py","file_url":"https://github.com/conglu1997/nppac/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2210.07484","paper":"/paper/mutual-information-regularized-offline-1","title":"Mutual Information Regularized Offline Reinforcement Learning","date":"2022-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sail-sg/MISA","path":"viskit/tabulate.py","file_url":"https://github.com/sail-sg/MISA/blob/HEAD/viskit/tabulate.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fd06199912f135e9","mcp_get_code":{"code_sha256":"fd06199912f135e9"}},{"arxiv_id":"2206.04745","paper":"/paper/mildly-conservative-q-learning-for-offline","title":"Mildly Conservative Q-Learning for Offline Reinforcement Learning","date":"2022-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vitchyr/rlkit","path":"rlkit/core/tabulate.py","file_url":"https://github.com/vitchyr/rlkit/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2110.03655","paper":"/paper/augmenting-reinforcement-learning-with","title":"Augmenting Reinforcement Learning with Behavior Primitives for Diverse Manipulation Tasks","date":"2021-10-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"UT-Austin-RPL/maple","path":"maple/core/tabulate.py","file_url":"https://github.com/UT-Austin-RPL/maple/blob/HEAD/maple/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2104.09122","paper":"/paper/probabilistic-mixture-of-experts-for-1","title":"Probabilistic Mixture-of-Experts for Efficient Deep Reinforcement Learning","date":"2021-04-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"JieRen98/rlkit-pmoe","path":"rlkit/core/tabulate.py","file_url":"https://github.com/JieRen98/rlkit-pmoe/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2010.08252","paper":"/paper/hyperparameter-auto-tuning-in-self-supervised","title":"Hyperparameter Auto-tuning in Self-Supervised Robotic Learning","date":"2020-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"birlrobotics/rlkit_autotune","path":"rlkit/core/tabulate.py","file_url":"https://github.com/birlrobotics/rlkit_autotune/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2007.09070","paper":"/paper/hybrid-discriminative-generative-training-via","title":"Hybrid Discriminative-Generative Training via Contrastive Learning","date":"2020-07-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lhao499/HDGE","path":"logger.py","file_url":"https://github.com/lhao499/HDGE/blob/HEAD/logger.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d6cc3c153cec4e1d","mcp_get_code":{"code_sha256":"d6cc3c153cec4e1d"}},{"arxiv_id":"2006.13916","paper":"/paper/off-dynamics-reinforcement-learning-training","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","date":"2020-06-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shreyasc-13/off_domain_rlkit","path":"rlkit/core/tabulate.py","file_url":"https://github.com/shreyasc-13/off_domain_rlkit/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2006.07034","paper":"/paper/unmasking-the-inductive-biases-of","title":"Benchmarking Unsupervised Object Representations for Video Sequences","date":"2020-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ecker-lab/object-centric-representation-benchmark","path":"ocrb/op3/core/tabulate.py","file_url":"https://github.com/ecker-lab/object-centric-representation-benchmark/blob/HEAD/ocrb/op3/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"2006.04779","paper":"/paper/conservative-q-learning-for-offline","title":"Conservative Q-Learning for Offline Reinforcement Learning","date":"2020-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ikostrikov/cql-results","path":"d4rl/rlkit/core/tabulate.py","file_url":"https://github.com/ikostrikov/cql-results/blob/HEAD/d4rl/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"1912.11032","paper":"/paper/towards-practical-multi-object-manipulation","title":"Towards Practical Multi-Object Manipulation using Relational Reinforcement Learning","date":"2019-12-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"richardrl/rlkit-relational","path":"rlkit/core/tabulate.py","file_url":"https://github.com/richardrl/rlkit-relational/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"1911.08453","paper":"/paper/planning-with-goal-conditioned-policies-1","title":"Planning with Goal-Conditioned Policies","date":"2019-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"snasiriany/leap","path":"railrl/core/tabulate.py","file_url":"https://github.com/snasiriany/leap/blob/HEAD/railrl/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"1910.12827","paper":"/paper/entity-abstraction-in-visual-model-based","title":"Entity Abstraction in Visual Model-Based Reinforcement Learning","date":"2019-10-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jcoreyes/OP3","path":"op3/core/tabulate.py","file_url":"https://github.com/jcoreyes/OP3/blob/HEAD/op3/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"1910.11670","paper":"/paper/contextual-imagined-goals-for-self-supervised","title":"Contextual Imagined Goals for Self-Supervised Robotic Learning","date":"2019-10-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anair13/rlkit","path":"rlkit/core/tabulate.py","file_url":"https://github.com/anair13/rlkit/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}},{"arxiv_id":"1903.08254","paper":"/paper/efficient-off-policy-meta-reinforcement","title":"Efficient Off-Policy Meta-Reinforcement Learning via Probabilistic Context Variables","date":"2019-03-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"victorchan314/cs287_final_project","path":"rlkit/core/tabulate.py","file_url":"https://github.com/victorchan314/cs287_final_project/blob/HEAD/rlkit/core/tabulate.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5cb0c55f58279f59","mcp_get_code":{"code_sha256":"5cb0c55f58279f59"}}]}