{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/discount-cumsum","entry":"discount_cumsum","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":35,"n_papers_ran":22,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":19,"n_samples_ran":7,"n_samples_fingerprinted":6,"n_places":39,"n_places_pointer_only":12,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":3,"ran_fixture":3,"ran":1,"unverified":12},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2604.19737","paper":"/paper/arxiv-2604-19737","title":"Safe Continual Reinforcement Learning in Non-stationary Environments","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"MACS-Research-Lab/safe-crl","path":"code/Safe-Policy-Optimization/safepo/common/buffer.py","file_url":"https://github.com/MACS-Research-Lab/safe-crl/blob/HEAD/code/Safe-Policy-Optimization/safepo/common/buffer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"185c4bf8b0d68d6c","mcp_get_code":{"code_sha256":"185c4bf8b0d68d6c"}},{"arxiv_id":"2603.21988","paper":"/paper/arxiv-2603-21988","title":"TREX: Trajectory Explanations for Multi-Objective Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":"dilina-r/trex_xmorl","path":"trex_cluster.py","file_url":"https://github.com/dilina-r/trex_xmorl/blob/HEAD/trex_cluster.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2dc44fc961aebd9a","mcp_get_code":{"code_sha256":"2dc44fc961aebd9a"}},{"arxiv_id":"2410.24108","paper":"/paper/reinforcement-learning-gradients-as-vitamin","title":"Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers","date":"2024-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kaiyan289/rl_as_vitamin_for_online_decision_transformers","path":"data.py","file_url":"https://github.com/kaiyan289/rl_as_vitamin_for_online_decision_transformers/blob/HEAD/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f434bf3e9ec07356","mcp_get_code":{"code_sha256":"f434bf3e9ec07356"}},{"arxiv_id":"2410.22391","paper":"/paper/a-large-recurrent-action-model-xlstm-enables","title":"A Large Recurrent Action Model: xLSTM enables Fast Inference for Robotics Tasks","date":"2024-10-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-jku/lram","path":"src/buffers/buffer_utils.py","file_url":"https://github.com/ml-jku/lram/blob/HEAD/src/buffers/buffer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"47f553906dc6d889","mcp_get_code":{"code_sha256":"47f553906dc6d889"}},{"arxiv_id":"2410.11448","paper":"/paper/meta-dt-offline-meta-rl-as-conditional","title":"Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement","date":"2024-10-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"NJU-RL/Meta-DT","path":"meta_dt/dataset.py","file_url":"https://github.com/NJU-RL/Meta-DT/blob/HEAD/meta_dt/dataset.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2410.07071","paper":"/paper/retrieval-augmented-decision-transformer","title":"Retrieval-Augmented Decision Transformer: External Memory for In-context RL","date":"2024-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-jku/RA-DT","path":"src/buffers/buffer_utils.py","file_url":"https://github.com/ml-jku/RA-DT/blob/HEAD/src/buffers/buffer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"47f553906dc6d889","mcp_get_code":{"code_sha256":"47f553906dc6d889"}},{"arxiv_id":"2406.05427","paper":"/paper/decision-mamba-a-multi-grained-state-space","title":"Decision Mamba: A Multi-Grained State Space Model with Self-Evolution Regularization for Offline RL","date":"2024-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aopolin-lv/DecisionMamba","path":"experiment-d4rl/experiment.py","file_url":"https://github.com/aopolin-lv/DecisionMamba/blob/HEAD/experiment-d4rl/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2405.20692","paper":"/paper/in-context-decision-transformer-reinforcement","title":"In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought","date":"2024-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2405.17098","paper":"/paper/q-value-regularized-transformer-for-offline","title":"Q-value Regularized Transformer for Offline Reinforcement Learning","date":"2024-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"charleshsc/qt","path":"experiment.py","file_url":"https://github.com/charleshsc/qt/blob/HEAD/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2405.12094","paper":"/paper/is-mamba-compatible-with-trajectory","title":"Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?","date":"2024-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AndssY/DeMa","path":"gym/experiment.py","file_url":"https://github.com/AndssY/DeMa/blob/HEAD/gym/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2403.07309","paper":"/paper/reinforced-sequential-decision-making-for","title":"Reinforced Sequential Decision-Making for Sepsis Treatment: The POSNEGDM Framework with Mortality Classifier and Transformer","date":"2024-03-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dipeshtamboli/posnegdm-reinforced-sequential-decision-making-for-sepsis-treatment","path":"utils.py","file_url":"https://github.com/dipeshtamboli/posnegdm-reinforced-sequential-decision-making-for-sepsis-treatment/blob/HEAD/utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2402.05808","paper":"/paper/training-large-language-models-for-reasoning","title":"Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning","date":"2024-02-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"woooodyy/llm-reverse-curriculum-rl","path":"R3_math/src/utils.py","file_url":"https://github.com/woooodyy/llm-reverse-curriculum-rl/blob/HEAD/R3_math/src/utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7ffa253a733f9bfc","mcp_get_code":{"code_sha256":"7ffa253a733f9bfc"}},{"arxiv_id":"2312.13716","paper":"/paper/critic-guided-decision-transformer-for","title":"Critic-Guided Decision Transformer for Offline Reinforcement Learning","date":"2023-12-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sharkwyf/cgdt","path":"data.py","file_url":"https://github.com/sharkwyf/cgdt/blob/HEAD/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f434bf3e9ec07356","mcp_get_code":{"code_sha256":"f434bf3e9ec07356"}},{"arxiv_id":"2310.20587","paper":"/paper/unleashing-the-power-of-pre-trained-language","title":"Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning","date":"2023-10-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"srzer/LaMo-2023","path":"experiment-d4rl/experiment.py","file_url":"https://github.com/srzer/LaMo-2023/blob/HEAD/experiment-d4rl/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2306.14884","paper":"/paper/learning-to-modulate-pre-trained-models-in-rl-1","title":"Learning to Modulate pre-trained Models in RL","date":"2023-06-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ml-jku/l2m","path":"src/buffers/buffer_utils.py","file_url":"https://github.com/ml-jku/l2m/blob/HEAD/src/buffers/buffer_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"47f553906dc6d889","mcp_get_code":{"code_sha256":"47f553906dc6d889"}},{"arxiv_id":"2305.16683","paper":"/paper/future-conditioned-unsupervised-pretraining","title":"Future-conditioned Unsupervised Pretraining for Decision Transformer","date":"2023-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fffffarmer/pdt","path":"src/data.py","file_url":"https://github.com/fffffarmer/pdt/blob/HEAD/src/data.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7ae6e29065b3cc4b","mcp_get_code":{"code_sha256":"7ae6e29065b3cc4b"}},{"arxiv_id":"2305.16217","paper":"/paper/beyond-reward-offline-preference-guided","title":"Beyond Reward: Offline Preference-guided Policy Optimization","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bkkgbkjb/oppo","path":"oppo/human/gym/experiment.py","file_url":"https://github.com/bkkgbkjb/oppo/blob/HEAD/oppo/human/gym/experiment.py","status":"ran_draft_wrong","verification_level":2,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7a477d732661f79a","mcp_get_code":{"code_sha256":"7a477d732661f79a"}},{"arxiv_id":"2305.16217","paper":"/paper/beyond-reward-offline-preference-guided","title":"Beyond Reward: Offline Preference-guided Policy Optimization","date":"2023-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"bkkgbkjb/oppo","path":"oppo/scripted/gym/experiment.py","file_url":"https://github.com/bkkgbkjb/oppo/blob/HEAD/oppo/scripted/gym/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2305.14550","paper":"/paper/2305-14550","title":"When should we prefer Decision Transformers for Offline Reinforcement Learning?","date":"2023-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"prajjwal1/rl_paradigm","path":"exorl/dataset.py","file_url":"https://github.com/prajjwal1/rl_paradigm/blob/HEAD/exorl/dataset.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2305.09836","paper":"/paper/revisiting-the-minimalist-approach-to-offline","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning","date":"2023-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adamjelley/efficientofflinerl","path":"algorithms/cql.py","file_url":"https://github.com/adamjelley/efficientofflinerl/blob/HEAD/algorithms/cql.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"d0c4a0aa6c8b23c1","mcp_get_code":{"code_sha256":"d0c4a0aa6c8b23c1"}},{"arxiv_id":"2305.09836","paper":"/paper/revisiting-the-minimalist-approach-to-offline","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning","date":"2023-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adamjelley/efficientofflinerl","path":"algorithms/edac.py","file_url":"https://github.com/adamjelley/efficientofflinerl/blob/HEAD/algorithms/edac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"04ad4ada1fd13ab2","mcp_get_code":{"code_sha256":"04ad4ada1fd13ab2"}},{"arxiv_id":"2305.09836","paper":"/paper/revisiting-the-minimalist-approach-to-offline","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning","date":"2023-05-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"adamjelley/efficientofflinerl","path":"algorithms/sac_n.py","file_url":"https://github.com/adamjelley/efficientofflinerl/blob/HEAD/algorithms/sac_n.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"e258d5be5c961c7a","mcp_get_code":{"code_sha256":"e258d5be5c961c7a"}},{"arxiv_id":"2303.07551","paper":"/paper/merging-decision-transformers-weight","title":"Merging Decision Transformers: Weight Averaging for Forming Multi-Task Policies","date":"2023-03-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"daniellawson9999/merging-decision-transformers","path":"decision-transformer/experiment.py","file_url":"https://github.com/daniellawson9999/merging-decision-transformers/blob/HEAD/decision-transformer/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2211.14655","paper":"/paper/how-crucial-is-transformer-in-decision","title":"How Crucial is Transformer in Decision Transformer?","date":"2022-11-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2211.09817","paper":"/paper/on-the-effect-of-pre-training-for-transformer","title":"On the Effect of Pre-training for Transformer in Different Modality on Offline Reinforcement Learning","date":"2022-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"machelreid/can-wikipedia-help-offline-rl","path":"code/eval_model.py","file_url":"https://github.com/machelreid/can-wikipedia-help-offline-rl/blob/HEAD/code/eval_model.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2211.09817","paper":"/paper/on-the-effect-of-pre-training-for-transformer","title":"On the Effect of Pre-training for Transformer in Different Modality on Offline Reinforcement Learning","date":"2022-11-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"t46/pre-training-different-modality-offline-rl","path":"can-wikipedia-help-offline-rl/experiment.py","file_url":"https://github.com/t46/pre-training-different-modality-offline-rl/blob/HEAD/can-wikipedia-help-offline-rl/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0d4fc87c387d9018","mcp_get_code":{"code_sha256":"0d4fc87c387d9018"}},{"arxiv_id":"2206.08353","paper":"/paper/towards-understanding-how-machines-can-learn","title":"Towards Understanding How Machines Can Learn Causal Overhypotheses","date":"2022-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cannylab/casual_overhypotheses","path":"models/decision-transformer/experiment.py","file_url":"https://github.com/cannylab/casual_overhypotheses/blob/HEAD/models/decision-transformer/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2206.01079","paper":"/paper/when-does-return-conditioned-supervised","title":"When does return-conditioned supervised learning work for offline reinforcement learning?","date":"2022-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"davidbrandfonbrener/rcsl-paper","path":"decision-transformer/gym/experiment.py","file_url":"https://github.com/davidbrandfonbrener/rcsl-paper/blob/HEAD/decision-transformer/gym/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2205.14842","paper":"/paper/efficient-reward-poisoning-attacks-on-online","title":"Efficient Reward Poisoning Attacks on Online Deep Reinforcement Learning","date":"2022-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yinglunxu/reward_poisoning_attack_drl","path":"src/all_class.py","file_url":"https://github.com/yinglunxu/reward_poisoning_attack_drl/blob/HEAD/src/all_class.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f047da47c4530c5f","mcp_get_code":{"code_sha256":"f047da47c4530c5f"}},{"arxiv_id":"2201.12122","paper":"/paper/can-wikipedia-help-offline-reinforcement","title":"Can Wikipedia Help Offline Reinforcement Learning?","date":"2022-01-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2111.10364","paper":"/paper/generalized-decision-transformer-for-offline","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","date":"2021-11-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":null,"inline_ok":false,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2110.06206","paper":"/paper/starformer-transformer-with-state-action-1","title":"StARformer: Transformer with State-Action-Reward Representations for Visual Reinforcement Learning","date":"2021-10-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"elicassion/StARformer","path":"gym/experiment.py","file_url":"https://github.com/elicassion/StARformer/blob/HEAD/gym/experiment.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2106.01345","paper":"/paper/decision-transformer-reinforcement-learning","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"HzcIrving/DecisionTransformer_StepbyStep","path":"utils.py","file_url":"https://github.com/HzcIrving/DecisionTransformer_StepbyStep/blob/HEAD/utils.py","status":"ran_fixture","verification_level":2,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0161b27cbe3cc58d","mcp_get_code":{"code_sha256":"0161b27cbe3cc58d"}},{"arxiv_id":"2007.02559","paper":"/paper/enhancing-sat-solvers-with-glue-variable","title":"Enhancing SAT solvers with glue variable predictions","date":"2020-07-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jesse-michael-han/neuro-cadical","path":"python/rl_loop.py","file_url":"https://github.com/jesse-michael-han/neuro-cadical/blob/HEAD/python/rl_loop.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"658d370f8dacf5e3","mcp_get_code":{"code_sha256":"658d370f8dacf5e3"}},{"arxiv_id":"2006.14171","paper":"/paper/a-closer-look-at-invalid-action-masking-in","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","date":"2020-06-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vwxyzjn/invalid-action-masking","path":"invalid_action_masking/ppo_10x10.py","file_url":"https://github.com/vwxyzjn/invalid-action-masking/blob/HEAD/invalid_action_masking/ppo_10x10.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"43887c9edd549830","mcp_get_code":{"code_sha256":"43887c9edd549830"}},{"arxiv_id":"1912.13465","paper":"/paper/reward-conditioned-policies","title":"Reward-Conditioned Policies","date":"2019-12-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TrentBrick/RewardConditionedUDRL","path":"control/agent.py","file_url":"https://github.com/TrentBrick/RewardConditionedUDRL/blob/HEAD/control/agent.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d90f855adb55e3ce","mcp_get_code":{"code_sha256":"d90f855adb55e3ce"}},{"arxiv_id":"1806.01347","paper":"/paper/importance-sampling-policy-evaluation-with-an","title":"Importance Sampling Policy Evaluation with an Estimated Behavior Policy","date":"2018-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LARG/regression-importance-sampling","path":"roboschool-experiments/common.py","file_url":"https://github.com/LARG/regression-importance-sampling/blob/HEAD/roboschool-experiments/common.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"128b553ce11b9774","mcp_get_code":{"code_sha256":"128b553ce11b9774"}},{"arxiv_id":"1805.09801","paper":"/paper/meta-gradient-reinforcement-learning","title":"Meta-Gradient Reinforcement Learning","date":"2018-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RobvanGastel/meta-rl-algorithms","path":"algos/mg_a2c/buffer.py","file_url":"https://github.com/RobvanGastel/meta-rl-algorithms/blob/HEAD/algos/mg_a2c/buffer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"85f38abd91775356","mcp_get_code":{"code_sha256":"85f38abd91775356"}},{"arxiv_id":"aaai_35251","paper":null,"title":"arXiv:aaai_35251","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Teddy298/continualworld-ppo","path":"continualworld/ppo/core.py","file_url":"https://github.com/Teddy298/continualworld-ppo/blob/HEAD/continualworld/ppo/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"13141eda72cfce23","mcp_get_code":{"code_sha256":"13141eda72cfce23"}}]}