{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/mlp-2","entry":"mlp","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":108,"n_papers_ran":69,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":76,"n_samples_ran":41,"n_samples_fingerprinted":2,"n_places":114,"n_places_pointer_only":33,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":21,"ran_fixture":4,"ran":16,"unverified":35},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2608.08040","paper":"/paper/arxiv-2608-08040","title":"A cylindrical neural approximation theorem for conditional laws of McKean-Vlasov equations with common noise","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"HmiouiReda/cylindrical-mckean-vlasov","path":"cylindrical.py","file_url":"https://github.com/HmiouiReda/cylindrical-mckean-vlasov/blob/HEAD/cylindrical.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"fd91c1e2b885950a","mcp_get_code":{"code_sha256":"fd91c1e2b885950a"}},{"arxiv_id":"2608.07870","paper":"/paper/arxiv-2608-07870","title":"V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"nicklashansen/tdmpc2","path":"tdmpc2/common/layers.py","file_url":"https://github.com/nicklashansen/tdmpc2/blob/HEAD/tdmpc2/common/layers.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"596a1441bb20a1c6","mcp_get_code":{"code_sha256":"596a1441bb20a1c6"}},{"arxiv_id":"2608.02332","paper":"/paper/arxiv-2608-02332","title":"Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"thu-ml/SRPO","path":"model.py","file_url":"https://github.com/thu-ml/SRPO/blob/HEAD/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d466e7f1c4364a0b","mcp_get_code":{"code_sha256":"d466e7f1c4364a0b"}},{"arxiv_id":"2606.19134","paper":"/paper/arxiv-2606-19134","title":"Pareto Q-Learning with Reward Machines","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"arnaudlequen/PQLRM","path":"baselines/common/networks.py","file_url":"https://github.com/arnaudlequen/PQLRM/blob/HEAD/baselines/common/networks.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"0be43fb4202eab1d","mcp_get_code":{"code_sha256":"0be43fb4202eab1d"}},{"arxiv_id":"2605.16692","paper":"/paper/arxiv-2605-16692","title":"EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"wertyuilife2/bmpc","path":"bmpc/common/layers.py","file_url":"https://github.com/wertyuilife2/bmpc/blob/HEAD/bmpc/common/layers.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"596a1441bb20a1c6","mcp_get_code":{"code_sha256":"596a1441bb20a1c6"}},{"arxiv_id":"2605.11975","paper":"/paper/arxiv-2605-11975","title":"Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"milanganai/milanganai.github.io","path":"NeurIPS2023/code/core_respo.py","file_url":"https://github.com/milanganai/milanganai.github.io/blob/HEAD/NeurIPS2023/code/core_respo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2605.09638","paper":"/paper/arxiv-2605-09638","title":"Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"rl-bandits-lab/RL-Backdoor","path":"backdoor_attack/multiagent_competition/fast_failing/train/ppo_core.py","file_url":"https://github.com/rl-bandits-lab/RL-Backdoor/blob/HEAD/backdoor_attack/multiagent_competition/fast_failing/train/ppo_core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2605.01242","paper":"/paper/arxiv-2605-01242","title":"Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"shelowize/lvrep-rl","path":"agent/ctrlsac/ctrlsac_agent.py","file_url":"https://github.com/shelowize/lvrep-rl/blob/HEAD/agent/ctrlsac/ctrlsac_agent.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bc4901b707963357","mcp_get_code":{"code_sha256":"bc4901b707963357"}},{"arxiv_id":"2603.29676","paper":"/paper/arxiv-2603-29676","title":"A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models","date":null,"month_inferred_from_arxiv_id":"2026-03","title_source":"syntology","repo":null,"path":"","file_url":null,"status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"25d792e8c00de62b","mcp_get_code":{"code_sha256":"25d792e8c00de62b"}},{"arxiv_id":"2602.18277","paper":"/paper/arxiv-2602-18277","title":"PRISM: Parallel Reward Integration with Symmetry for MORL","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"EVIEHub/PRISM","path":"code/morl_baselines/common/networks.py","file_url":"https://github.com/EVIEHub/PRISM/blob/HEAD/code/morl_baselines/common/networks.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0be43fb4202eab1d","mcp_get_code":{"code_sha256":"0be43fb4202eab1d"}},{"arxiv_id":"2602.16198","paper":"/paper/arxiv-2602-16198","title":"Training-Free Adaptation of Diffusion Models via Doob's h-Transform","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"liamyzq/Doob_training_free_adaptation","path":"search/doob_search.py","file_url":"https://github.com/liamyzq/Doob_training_free_adaptation/blob/HEAD/search/doob_search.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d466e7f1c4364a0b","mcp_get_code":{"code_sha256":"d466e7f1c4364a0b"}},{"arxiv_id":"2602.10793","paper":"/paper/arxiv-2602-10793","title":"Semi-Supervised Cross-Domain Imitation Learning","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"facebookresearch/gwil","path":"utils.py","file_url":"https://github.com/facebookresearch/gwil/blob/HEAD/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"db00dda8b96201d3","mcp_get_code":{"code_sha256":"db00dda8b96201d3"}},{"arxiv_id":"2602.08584","paper":"/paper/arxiv-2602-08584","title":"Conditional Sequence Modeling for Safe Reinforcement Learning","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"liuzuxin/OSRL","path":"osrl/common/net.py","file_url":"https://github.com/liuzuxin/OSRL/blob/HEAD/osrl/common/net.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cb1929149ecc4471","mcp_get_code":{"code_sha256":"cb1929149ecc4471"}},{"arxiv_id":"2510.10744","paper":"/paper/arxiv-2510-10744","title":"How Patterns Dictate Learnability in Sequential Data","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"EkMeasurable/Learnability_Ipred","path":"utils/estimators.py","file_url":"https://github.com/EkMeasurable/Learnability_Ipred/blob/HEAD/utils/estimators.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"de9c360366d3ff62","mcp_get_code":{"code_sha256":"de9c360366d3ff62"}},{"arxiv_id":"2506.07255","paper":null,"title":"arXiv:2506.07255","date":null,"month_inferred_from_arxiv_id":"2025-06","title_source":null,"repo":"jacobandreas/psketch","path":"models/net.py","file_url":"https://github.com/jacobandreas/psketch/blob/HEAD/models/net.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cb7804b9a14c70d7","mcp_get_code":{"code_sha256":"cb7804b9a14c70d7"}},{"arxiv_id":"2506.02612","paper":"/paper/simple-good-fast-self-supervised-world-models","title":"Simple, Good, Fast: Self-Supervised World Models Free of Baggage","date":"2025-06-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jrobine/sgf","path":"src/wm.py","file_url":"https://github.com/jrobine/sgf/blob/HEAD/src/wm.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"82d342964b41dc7f","mcp_get_code":{"code_sha256":"82d342964b41dc7f"}},{"arxiv_id":"2504.06386","paper":null,"title":"arXiv:2504.06386","date":null,"month_inferred_from_arxiv_id":"2025-04","title_source":null,"repo":"JacquesCloete/sport","path":"src/sport/rl/algos/projected_ppo/core.py","file_url":"https://github.com/JacquesCloete/sport/blob/HEAD/src/sport/rl/algos/projected_ppo/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"61b48ea6bc10d51e","mcp_get_code":{"code_sha256":"61b48ea6bc10d51e"}},{"arxiv_id":"2503.00653","paper":"/paper/discrete-codebook-world-models-for-continuous","title":"Discrete Codebook World Models for Continuous Control","date":"2025-03-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aidanscannell/dcmpc","path":"utils/layers.py","file_url":"https://github.com/aidanscannell/dcmpc/blob/HEAD/utils/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"9acd81aa05192bdb","mcp_get_code":{"code_sha256":"9acd81aa05192bdb"}},{"arxiv_id":"2502.12152","paper":"/paper/learning-getting-up-policies-for-real-world","title":"Learning Getting-Up Policies for Real-World Humanoid Robots","date":"2025-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RunpeiDong/HumanUP","path":"simulation/rsl_rl/rsl_rl/utils/layers.py","file_url":"https://github.com/RunpeiDong/HumanUP/blob/HEAD/simulation/rsl_rl/rsl_rl/utils/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"fc4e341b9c79e617","mcp_get_code":{"code_sha256":"fc4e341b9c79e617"}},{"arxiv_id":"2410.23022","paper":"/paper/online-intrinsic-rewards-for-decision-making","title":"Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback","date":"2024-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/oni","path":"rlaif/reward_model.py","file_url":"https://github.com/facebookresearch/oni/blob/HEAD/rlaif/reward_model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"286f16b8cdd48f8f","mcp_get_code":{"code_sha256":"286f16b8cdd48f8f"}},{"arxiv_id":"2410.08751","paper":"/paper/zero-shot-offline-imitation-learning-via","title":"Zero-Shot Offline Imitation Learning via Optimal Transport","date":"2024-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"martius-lab/zilot","path":"zilot/model/curious.py","file_url":"https://github.com/martius-lab/zilot/blob/HEAD/zilot/model/curious.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cad2da135c7b87f7","mcp_get_code":{"code_sha256":"cad2da135c7b87f7"}},{"arxiv_id":"2409.12514","paper":"/paper/tinyvla-towards-fast-data-efficient-vision","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","date":"2024-09-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liyaxuanliyaxuan/TinyVLA","path":"policy_heads/models/detr_vae.py","file_url":"https://github.com/liyaxuanliyaxuan/TinyVLA/blob/HEAD/policy_heads/models/detr_vae.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6fc99436fb828638","mcp_get_code":{"code_sha256":"6fc99436fb828638"}},{"arxiv_id":"2407.14653","paper":"/paper/oasis-conditional-distribution-shaping-for","title":"OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning","date":"2024-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yihangyao/OASIS","path":"OSRL/osrl/common/net.py","file_url":"https://github.com/yihangyao/OASIS/blob/HEAD/OSRL/osrl/common/net.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cb1929149ecc4471","mcp_get_code":{"code_sha256":"cb1929149ecc4471"}},{"arxiv_id":"2407.13195","paper":"/paper/adaptive-foundation-models-for-online","title":"Scalable Exploration via Ensemble++","date":"2024-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"szrlee/ensemble_plus_plus","path":"network/ensemble_exp.py","file_url":"https://github.com/szrlee/ensemble_plus_plus/blob/HEAD/network/ensemble_exp.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bc22b388af547818","mcp_get_code":{"code_sha256":"bc22b388af547818"}},{"arxiv_id":"2407.13195","paper":"/paper/adaptive-foundation-models-for-online","title":"Scalable Exploration via Ensemble++","date":"2024-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"szrlee/GPT-HyperAgent","path":"network/epinet.py","file_url":"https://github.com/szrlee/GPT-HyperAgent/blob/HEAD/network/epinet.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5936968885fd5884","mcp_get_code":{"code_sha256":"5936968885fd5884"}},{"arxiv_id":"2407.09024","paper":"/paper/aligning-diffusion-behaviors-with-q-functions","title":"Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control","date":"2024-07-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"thu-ml/Efficient-Diffusion-Alignment","path":"model.py","file_url":"https://github.com/thu-ml/Efficient-Diffusion-Alignment/blob/HEAD/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"d466e7f1c4364a0b","mcp_get_code":{"code_sha256":"d466e7f1c4364a0b"}},{"arxiv_id":"2406.16004","paper":"/paper/repnext-a-fast-multi-scale-cnn-using","title":"RepNeXt: A Fast Multi-Scale CNN using Structural Reparameterization","date":"2024-06-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"suous/repnext","path":"detection/repnext.py","file_url":"https://github.com/suous/repnext/blob/HEAD/detection/repnext.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5b6fdf4c5a3bc3fa","mcp_get_code":{"code_sha256":"5b6fdf4c5a3bc3fa"}},{"arxiv_id":"2405.19690","paper":"/paper/diffusion-policies-creating-a-trust-region","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"TianyuCodings/Diffusion_Trusted_Q_Learning","path":"agents/model.py","file_url":"https://github.com/TianyuCodings/Diffusion_Trusted_Q_Learning/blob/HEAD/agents/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2405.19690","paper":"/paper/diffusion-policies-creating-a-trust-region","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","date":"2024-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tianyucodings/diffusion_trusted_q_learning","path":"agents/dtql.py","file_url":"https://github.com/tianyucodings/diffusion_trusted_q_learning/blob/HEAD/agents/dtql.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"db00dda8b96201d3","mcp_get_code":{"code_sha256":"db00dda8b96201d3"}},{"arxiv_id":"2405.16158","paper":"/paper/bigger-regularized-optimistic-scaling-for","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","date":"2024-05-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"denisyarats/pytorch_sac","path":"utils.py","file_url":"https://github.com/denisyarats/pytorch_sac/blob/HEAD/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"db00dda8b96201d3","mcp_get_code":{"code_sha256":"db00dda8b96201d3"}},{"arxiv_id":"2405.15177","paper":"/paper/diffusion-actor-critic-with-entropy-regulator","title":"Diffusion Actor-Critic with Entropy Regulator","date":"2024-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"happy-yan/DACER-Diffusion-with-Online-RL","path":"relax/network/blocks.py","file_url":"https://github.com/happy-yan/DACER-Diffusion-with-Online-RL/blob/HEAD/relax/network/blocks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"ab957cbc27bee860","mcp_get_code":{"code_sha256":"ab957cbc27bee860"}},{"arxiv_id":"2405.14847","paper":"/paper/neural-directional-encoding-for-efficient-and","title":"Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance Modeling","date":"2024-05-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lwwu2/nde","path":"model/encoding.py","file_url":"https://github.com/lwwu2/nde/blob/HEAD/model/encoding.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"32bc26fbd416c698","mcp_get_code":{"code_sha256":"32bc26fbd416c698"}},{"arxiv_id":"2404.14076","paper":"/paper/noise-contrastive-estimation-with-soft","title":"Towards noise contrastive estimation with soft targets for conditional models","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uhlmanngroup/soft-target-infonce","path":"util/vit.py","file_url":"https://github.com/uhlmanngroup/soft-target-infonce/blob/HEAD/util/vit.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"66d034d2868cf2e3","mcp_get_code":{"code_sha256":"66d034d2868cf2e3"}},{"arxiv_id":"2404.14064","paper":"/paper/multi-view-disentanglement-for-reinforcement","title":"Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras","date":"2024-04-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"uoe-agents/mvd","path":"utils.py","file_url":"https://github.com/uoe-agents/mvd/blob/HEAD/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2404.05440","paper":"/paper/tree-search-based-policy-optimization-under","title":"Tree Search-Based Policy Optimization under Stochastic Execution Delay","date":"2024-04-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"davidva1/Delayed-EZ","path":"config/atari/model.py","file_url":"https://github.com/davidva1/Delayed-EZ/blob/HEAD/config/atari/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"7af8d641a39b4ee5","mcp_get_code":{"code_sha256":"7af8d641a39b4ee5"}},{"arxiv_id":"2404.03037","paper":"/paper/model-based-reinforcement-learning-for-7","title":"Model-based Reinforcement Learning for Parameterized Action Spaces","date":"2024-04-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"valarzz/dlpa","path":"models/networks.py","file_url":"https://github.com/valarzz/dlpa/blob/HEAD/models/networks.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"8c6d7bf8521d9aaf","mcp_get_code":{"code_sha256":"8c6d7bf8521d9aaf"}},{"arxiv_id":"2403.11998","paper":"/paper/learning-useful-representations-of-recurrent","title":"Learning Useful Representations of Recurrent Neural Network Weight Matrices","date":"2024-03-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vincentherrmann/rnn-weights-representation-learning","path":"rnn_weights_representation_learning/modules_rnn_encoders.py","file_url":"https://github.com/vincentherrmann/rnn-weights-representation-learning/blob/HEAD/rnn_weights_representation_learning/modules_rnn_encoders.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"173e195e1fe036cf","mcp_get_code":{"code_sha256":"173e195e1fe036cf"}},{"arxiv_id":"2403.00564","paper":"/paper/efficientzero-v2-mastering-discrete-and","title":"EfficientZero V2: Mastering Discrete and Continuous Control with Limited Data","date":"2024-03-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"shengjiewang-jason/efficientzerov2","path":"ez/agents/models/layer.py","file_url":"https://github.com/shengjiewang-jason/efficientzerov2/blob/HEAD/ez/agents/models/layer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"GPL-3.0","inline_ok":false,"code_sha256_prefix":"1fcac51bd776abb0","mcp_get_code":{"code_sha256":"1fcac51bd776abb0"}},{"arxiv_id":"2402.00348","paper":"/paper/odice-revealing-the-mystery-of-distribution","title":"ODICE: Revealing the Mystery of Distribution Correction Estimation via Orthogonal-gradient Update","date":"2024-02-01","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"maoliyuan/ODICE-Pytorch","path":"util.py","file_url":"https://github.com/maoliyuan/ODICE-Pytorch/blob/HEAD/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"3448a21f1f811223","mcp_get_code":{"code_sha256":"3448a21f1f811223"}},{"arxiv_id":"2401.14758","paper":"/paper/off-policy-primal-dual-safe-reinforcement","title":"Off-Policy Primal-Dual Safe Reinforcement Learning","date":"2024-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"AlgTUDelft/WCSAC","path":"wc_sac/sac/wcsac.py","file_url":"https://github.com/AlgTUDelft/WCSAC/blob/HEAD/wc_sac/sac/wcsac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e6f12e62f88b74b9","mcp_get_code":{"code_sha256":"e6f12e62f88b74b9"}},{"arxiv_id":"2312.17116","paper":"/paper/generalizable-visual-reinforcement-learning","title":"Generalizable Visual Reinforcement Learning with Segment Anything Model","date":"2023-12-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wadiuvatzy/sam-g","path":"algos/drq.py","file_url":"https://github.com/wadiuvatzy/sam-g/blob/HEAD/algos/drq.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2311.12495","paper":"/paper/multi-objective-reinforcement-learning-based-2","title":"Multi-Objective Reinforcement Learning Based on Decomposition: A Taxonomy and Framework","date":"2023-11-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lucasalegre/morl-baselines","path":"morl_baselines/common/networks.py","file_url":"https://github.com/lucasalegre/morl-baselines/blob/HEAD/morl_baselines/common/networks.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0be43fb4202eab1d","mcp_get_code":{"code_sha256":"0be43fb4202eab1d"}},{"arxiv_id":"2311.11557","paper":"/paper/replay-enhanced-continual-reinforcement","title":"Replay-enhanced Continual Reinforcement Learning","date":"2023-11-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Sweety-dm/RECALL","path":"myrecall/sac/models.py","file_url":"https://github.com/Sweety-dm/RECALL/blob/HEAD/myrecall/sac/models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d8d6e9ae3541d61c","mcp_get_code":{"code_sha256":"d8d6e9ae3541d61c"}},{"arxiv_id":"2310.16828","paper":"/paper/td-mpc2-scalable-robust-world-models-for","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","date":"2023-10-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nicklashansen/tdmpc","path":"src/algorithm/tdmpc.py","file_url":"https://github.com/nicklashansen/tdmpc/blob/HEAD/src/algorithm/tdmpc.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"8c6d7bf8521d9aaf","mcp_get_code":{"code_sha256":"8c6d7bf8521d9aaf"}},{"arxiv_id":"2310.05858","paper":"/paper/dsac-t-distributional-soft-actor-critic-with","title":"Distributional Soft Actor-Critic with Three Refinements","date":"2023-10-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jingliang-duan/dsac-t","path":"networks/mlp.py","file_url":"https://github.com/jingliang-duan/dsac-t/blob/HEAD/networks/mlp.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2309.05098","paper":"/paper/3d-implicit-transporter-for-temporally","title":"3D Implicit Transporter for Temporally Consistent Keypoint Discovery","date":"2023-09-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhongcl-thu/3D-Implicit-Transporter","path":"core/nets/model_utils.py","file_url":"https://github.com/zhongcl-thu/3D-Implicit-Transporter/blob/HEAD/core/nets/model_utils.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f28b37b553b6d834","mcp_get_code":{"code_sha256":"f28b37b553b6d834"}},{"arxiv_id":"2308.14947","paper":"/paper/improving-reinforcement-learning-training","title":"Improving Generalization in Reinforcement Learning Training Regimes for Social Robot Navigation","date":"2023-08-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RAISE-Lab/soc-nav-training","path":"CrowdNav/crowd_nav/policy/cadrl.py","file_url":"https://github.com/RAISE-Lab/soc-nav-training/blob/HEAD/CrowdNav/crowd_nav/policy/cadrl.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"41b3a883a96e7454","mcp_get_code":{"code_sha256":"41b3a883a96e7454"}},{"arxiv_id":"2307.16377","paper":"/paper/jotr-3d-joint-contrastive-learning-with","title":"JOTR: 3D Joint Contrastive Learning with Transformers for Occluded Human Mesh Recovery","date":"2023-07-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xljh0520/jotr","path":"common/model.py","file_url":"https://github.com/xljh0520/jotr/blob/HEAD/common/model.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"59f9b871646fa8fb","mcp_get_code":{"code_sha256":"59f9b871646fa8fb"}},{"arxiv_id":"2307.10224","paper":"/paper/rl-vigen-a-reinforcement-learning-benchmark-1","title":"RL-ViGen: A Reinforcement Learning Benchmark for Visual Generalization","date":"2023-07-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gemcollector/rl-vigen","path":"algos/drq.py","file_url":"https://github.com/gemcollector/rl-vigen/blob/HEAD/algos/drq.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2306.04539","paper":"/paper/multimodal-learning-without-labeled","title":"Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications","date":"2023-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pliang279/pid","path":"estimators/ce_alignment_information.py","file_url":"https://github.com/pliang279/pid/blob/HEAD/estimators/ce_alignment_information.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"25d792e8c00de62b","mcp_get_code":{"code_sha256":"25d792e8c00de62b"}},{"arxiv_id":"2306.00035","paper":"/paper/rosarl-reward-only-safe-reinforcement","title":"ROSARL: Reward-Only Safe Reinforcement Learning","date":"2023-05-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"geraudnt/rosarl","path":"safety_ai_gym/safety-starter-agents/safe_rl/pg/network.py","file_url":"https://github.com/geraudnt/rosarl/blob/HEAD/safety_ai_gym/safety-starter-agents/safe_rl/pg/network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"2305.01777","paper":"/paper/representation-learning-via-manifold","title":"Representation Learning via Manifold Flattening and Reconstruction","date":"2023-05-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"michael-psenka/manifold-linearization","path":"models/operators.py","file_url":"https://github.com/michael-psenka/manifold-linearization/blob/HEAD/models/operators.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"32b2f7c1d7e77097","mcp_get_code":{"code_sha256":"32b2f7c1d7e77097"}},{"arxiv_id":"2304.14329","paper":"/paper/learning-to-extrapolate-a-transductive","title":"Learning to Extrapolate: A Transductive Approach","date":"2023-04-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"avivne/bilinear-transduction","path":"utils/networks.py","file_url":"https://github.com/avivne/bilinear-transduction/blob/HEAD/utils/networks.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"db00dda8b96201d3","mcp_get_code":{"code_sha256":"db00dda8b96201d3"}},{"arxiv_id":"2304.14329","paper":"/paper/learning-to-extrapolate-a-transductive","title":"Learning to Extrapolate: A Transductive Approach","date":"2023-04-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"learningmatter-mit/matex","path":"blt/utils/networks.py","file_url":"https://github.com/learningmatter-mit/matex/blob/HEAD/blt/utils/networks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ebb5e4d5764029a8","mcp_get_code":{"code_sha256":"ebb5e4d5764029a8"}},{"arxiv_id":"2302.14040","paper":"/paper/permutation-equivariant-neural-functionals-1","title":"Permutation Equivariant Neural Functionals","date":"2023-02-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jkalogero/scalegmn","path":"src/scalegmn/layers.py","file_url":"https://github.com/jkalogero/scalegmn/blob/HEAD/src/scalegmn/layers.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"67d3763fe4254040","mcp_get_code":{"code_sha256":"67d3763fe4254040"}},{"arxiv_id":"2302.12247","paper":"/paper/quantifying-modeling-multimodal-interactions-1","title":"Quantifying & Modeling Multimodal Interactions: An Information Decomposition Framework","date":"2023-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pliang279/pid","path":"estimators/ce_alignment_information.py","file_url":"https://github.com/pliang279/pid/blob/HEAD/estimators/ce_alignment_information.py","status":"unverified","verification_level":0,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a1dadeb1ac1d82ee","mcp_get_code":{"code_sha256":"a1dadeb1ac1d82ee"}},{"arxiv_id":"2302.12238","paper":"/paper/improving-adaptive-conformal-prediction-using","title":"Improving Adaptive Conformal Prediction Using Self-Supervised Learning","date":"2023-02-23","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"seedatnabeel/sscp","path":"src/VIME/supervised_models.py","file_url":"https://github.com/seedatnabeel/sscp/blob/HEAD/src/VIME/supervised_models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5785647801cd5536","mcp_get_code":{"code_sha256":"5785647801cd5536"}},{"arxiv_id":"2302.10184","paper":"/paper/on-robust-numerical-solver-for-ode-via-self","title":"AttNS: Attention-Inspired Numerical Solving For Limited Data Scenarios","date":"2023-02-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dedekinds/neurvec","path":"cases/elastic_pend/models.py","file_url":"https://github.com/dedekinds/neurvec/blob/HEAD/cases/elastic_pend/models.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a698b8109aece8f4","mcp_get_code":{"code_sha256":"a698b8109aece8f4"}},{"arxiv_id":"2302.07351","paper":"/paper/constrained-decision-transformer-for-offline","title":"Constrained Decision Transformer for Offline Safe Reinforcement Learning","date":"2023-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liuzuxin/osrl","path":"osrl/algorithms/cdt.py","file_url":"https://github.com/liuzuxin/osrl/blob/HEAD/osrl/algorithms/cdt.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"cb1929149ecc4471","mcp_get_code":{"code_sha256":"cb1929149ecc4471"}},{"arxiv_id":"2302.00808","paper":"/paper/average-constrained-policy-optimization","title":"ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints","date":"2023-02-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openai/safety-starter-agents","path":"safe_rl/pg/network.py","file_url":"https://github.com/openai/safety-starter-agents/blob/HEAD/safe_rl/pg/network.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"2301.10923","paper":"/paper/efficient-trust-region-based-safe","title":"Trust Region-Based Safe Distributional Reinforcement Learning for Multiple Constraints","date":"2023-01-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rllab-snu/Safe-Distributional-Actor-Critic","path":"safety_gym/cvpo/safe_rl/policy/model/mlp_ac.py","file_url":"https://github.com/rllab-snu/Safe-Distributional-Actor-Critic/blob/HEAD/safety_gym/cvpo/safe_rl/policy/model/mlp_ac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2bc10041d414773a","mcp_get_code":{"code_sha256":"2bc10041d414773a"}},{"arxiv_id":"2211.00801","paper":"/paper/multi-agent-reinforcement-learning-for-13","title":"Multi-Agent Reinforcement Learning for Adaptive Mesh Refinement","date":"2022-11-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"011235813/marl-amr","path":"marl_amr/alg/networks.py","file_url":"https://github.com/011235813/marl-amr/blob/HEAD/marl_amr/alg/networks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"BSD-3-Clause","inline_ok":true,"code_sha256_prefix":"841b1316c52b02a5","mcp_get_code":{"code_sha256":"841b1316c52b02a5"}},{"arxiv_id":"2210.10763","paper":"/paper/on-the-feasibility-of-cross-task-transfer","title":"On the Feasibility of Cross-Task Transfer with Model-Based Reinforcement Learning","date":"2022-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mlpc-ucsd/xtra","path":"src/config/atari/model.py","file_url":"https://github.com/mlpc-ucsd/xtra/blob/HEAD/src/config/atari/model.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"a688f4e7c0e44610","mcp_get_code":{"code_sha256":"a688f4e7c0e44610"}},{"arxiv_id":"2210.09598","paper":"/paper/planning-for-sample-efficient-imitation","title":"Planning for Sample Efficient Imitation Learning","date":"2022-10-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"zhaohengyin/EfficientImitate","path":"algo/obs_ei/model.py","file_url":"https://github.com/zhaohengyin/EfficientImitate/blob/HEAD/algo/obs_ei/model.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4c8aa25db20d758e","mcp_get_code":{"code_sha256":"4c8aa25db20d758e"}},{"arxiv_id":"2210.07573","paper":"/paper/model-based-safe-deep-reinforcement-learning","title":"Model-based Safe Deep Reinforcement Learning via a Constrained Proximal Policy Optimization Algorithm","date":"2022-10-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"akjayant/mbppol","path":"src/core.py","file_url":"https://github.com/akjayant/mbppol/blob/HEAD/src/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2210.06702","paper":"/paper/a-mixture-of-surprises-for-unsupervised","title":"A Mixture of Surprises for Unsupervised Reinforcement Learning","date":"2022-10-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LeapLabTHU/MOSS","path":"core/calculations/layers.py","file_url":"https://github.com/LeapLabTHU/MOSS/blob/HEAD/core/calculations/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"8f66a508eba0c6bc","mcp_get_code":{"code_sha256":"8f66a508eba0c6bc"}},{"arxiv_id":"2210.05663","paper":"/paper/clip-fields-weakly-supervised-semantic-fields","title":"CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory","date":"2022-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"notmahi/clip-fields","path":"misc.py","file_url":"https://github.com/notmahi/clip-fields/blob/HEAD/misc.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aee85acbd82e6f57","mcp_get_code":{"code_sha256":"aee85acbd82e6f57"}},{"arxiv_id":"2207.01566","paper":"/paper/general-policy-evaluation-and-improvement-by","title":"General Policy Evaluation and Improvement by Learning to Identify Few But Crucial States","date":"2022-07-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"idsia/policyevaluator","path":"core.py","file_url":"https://github.com/idsia/policyevaluator/blob/HEAD/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2206.11251","paper":"/paper/behavior-transformers-cloning-k-modes-with","title":"Behavior Transformers: Cloning $k$ modes with one stone","date":"2022-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"notmahi/bet","path":"models/mlp.py","file_url":"https://github.com/notmahi/bet/blob/HEAD/models/mlp.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"aee85acbd82e6f57","mcp_get_code":{"code_sha256":"aee85acbd82e6f57"}},{"arxiv_id":"2206.11251","paper":"/paper/behavior-transformers-cloning-k-modes-with","title":"Behavior Transformers: Cloning $k$ modes with one stone","date":"2022-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"skandermoalla/bet-reproduction","path":"models/mlp.py","file_url":"https://github.com/skandermoalla/bet-reproduction/blob/HEAD/models/mlp.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"15820c0b4be13799","mcp_get_code":{"code_sha256":"15820c0b4be13799"}},{"arxiv_id":"2205.14842","paper":"/paper/efficient-reward-poisoning-attacks-on-online","title":"Efficient Reward Poisoning Attacks on Online Deep Reinforcement Learning","date":"2022-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yinglunxu/reward_poisoning_attack_drl","path":"src/all_class.py","file_url":"https://github.com/yinglunxu/reward_poisoning_attack_drl/blob/HEAD/src/all_class.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c31034abc86fa912","mcp_get_code":{"code_sha256":"c31034abc86fa912"}},{"arxiv_id":"2205.14691","paper":"/paper/on-the-robustness-of-safe-reinforcement","title":"On the Robustness of Safe Reinforcement Learning under Observational Perturbations","date":"2022-05-29","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"liuzuxin/safe-rl-robustness","path":"rsrl/policy/model/mlp_ac.py","file_url":"https://github.com/liuzuxin/safe-rl-robustness/blob/HEAD/rsrl/policy/model/mlp_ac.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2bc10041d414773a","mcp_get_code":{"code_sha256":"2bc10041d414773a"}},{"arxiv_id":"2205.08119","paper":"/paper/shiftaddnas-hardware-inspired-search-for-more-1","title":"ShiftAddNAS: Hardware-Inspired Search for More Accurate and Efficient Neural Networks","date":"2022-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rice-eic/shiftaddnas","path":"NLP/en-de/sim/ShiftAddNAS.py","file_url":"https://github.com/rice-eic/shiftaddnas/blob/HEAD/NLP/en-de/sim/ShiftAddNAS.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"feb0251826142c84","mcp_get_code":{"code_sha256":"feb0251826142c84"}},{"arxiv_id":"2205.08119","paper":"/paper/shiftaddnas-hardware-inspired-search-for-more-1","title":"ShiftAddNAS: Hardware-Inspired Search for More Accurate and Efficient Neural Networks","date":"2022-05-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"rice-eic/shiftaddnas","path":"NLP/en-de/sim/ShiftAddNAS_all_shift.py","file_url":"https://github.com/rice-eic/shiftaddnas/blob/HEAD/NLP/en-de/sim/ShiftAddNAS_all_shift.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b3a2d2310366d914","mcp_get_code":{"code_sha256":"b3a2d2310366d914"}},{"arxiv_id":"2111.03941","paper":"/paper/time-discretization-invariant-safe-action","title":"Time Discretization-Invariant Safe Action Repetition for Policy Gradient Methods","date":"2021-11-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"artberryx/SAR","path":"sb/stable_baselines/common/tf_layers.py","file_url":"https://github.com/artberryx/SAR/blob/HEAD/sb/stable_baselines/common/tf_layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b1b0b13946e3393b","mcp_get_code":{"code_sha256":"b1b0b13946e3393b"}},{"arxiv_id":"2111.00210","paper":"/paper/mastering-atari-games-with-limited-data","title":"Mastering Atari Games with Limited Data","date":"2021-10-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"werner-duvaud/muzero-general","path":"models.py","file_url":"https://github.com/werner-duvaud/muzero-general/blob/HEAD/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"0de5facee665b75a","mcp_get_code":{"code_sha256":"0de5facee665b75a"}},{"arxiv_id":"2110.14074","paper":"/paper/fault-tolerant-federated-reinforcement","title":"Fault-Tolerant Federated Reinforcement Learning with Theoretical Guarantee","date":"2021-10-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"flint-xf-fan/Byzantine-Federeated-RL","path":"codes/agent.py","file_url":"https://github.com/flint-xf-fan/Byzantine-Federeated-RL/blob/HEAD/codes/agent.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6c9476fe07fb0a8b","mcp_get_code":{"code_sha256":"6c9476fe07fb0a8b"}},{"arxiv_id":"2110.04935","paper":"/paper/learning-temporally-consistent-1","title":"Learning Temporally-Consistent Representations for Data-Efficient Reinforcement Learning","date":"2021-10-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"anon-researcher-repo/ksl","path":"ksl/utils.py","file_url":"https://github.com/anon-researcher-repo/ksl/blob/HEAD/ksl/utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2109.12286","paper":"/paper/stackelberg-actor-critic-game-theoretic","title":"Stackelberg Actor-Critic: Game-Theoretic Reinforcement Learning Algorithms","date":"2021-09-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"leozhengzly/stackelberg-actor-critic-algos","path":"spinup/algos/pytorch/ddpg/core.py","file_url":"https://github.com/leozhengzly/stackelberg-actor-critic-algos/blob/HEAD/spinup/algos/pytorch/ddpg/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2108.08810","paper":"/paper/do-vision-transformers-see-like-convolutional","title":"Do Vision Transformers See Like Convolutional Neural Networks?","date":"2021-08-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sayakpaul/probing-vits","path":"vit/models.py","file_url":"https://github.com/sayakpaul/probing-vits/blob/HEAD/vit/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"634feb32dddf418f","mcp_get_code":{"code_sha256":"634feb32dddf418f"}},{"arxiv_id":"2107.01952","paper":"/paper/partition-and-code-learning-how-to-compress","title":"Partition and Code: learning how to compress graphs","date":"2021-07-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"gbouritsas/PnC","path":"models/GNN_neural_part_subgraph_selection.py","file_url":"https://github.com/gbouritsas/PnC/blob/HEAD/models/GNN_neural_part_subgraph_selection.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"cd5a40ffd4482a6d","mcp_get_code":{"code_sha256":"cd5a40ffd4482a6d"}},{"arxiv_id":"2106.09110","paper":"/paper/safe-reinforcement-learning-using-advantage","title":"Safe Reinforcement Learning Using Advantage-Based Intervention","date":"2021-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"nolanwagener/safe_rl","path":"safe_rl/algos/cppo/core.py","file_url":"https://github.com/nolanwagener/safe_rl/blob/HEAD/safe_rl/algos/cppo/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2106.05200","paper":"/paper/independent-mechanism-analysis-a-new-concept","title":"Independent mechanism analysis, a new concept?","date":"2021-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lgresele/independent-mechanism-analysis","path":"ima/residual.py","file_url":"https://github.com/lgresele/independent-mechanism-analysis/blob/HEAD/ima/residual.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"6863a4959e32eff4","mcp_get_code":{"code_sha256":"6863a4959e32eff4"}},{"arxiv_id":"2106.01345","paper":"/paper/decision-transformer-reinforcement-learning","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","date":"2021-06-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"facebookresearch/salina","path":"salina_examples/offline_rl/decision_transformer/agents.py","file_url":"https://github.com/facebookresearch/salina/blob/HEAD/salina_examples/offline_rl/decision_transformer/agents.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"4e4aebc21d42fb20","mcp_get_code":{"code_sha256":"4e4aebc21d42fb20"}},{"arxiv_id":"2105.13345","paper":"/paper/adversarial-intrinsic-motivation-for","title":"Adversarial Intrinsic Motivation for Reinforcement Learning","date":"2021-05-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"iDurugkar/adversarial-intrinsic-motivation","path":"stable_baselines/common/tf_layers.py","file_url":"https://github.com/iDurugkar/adversarial-intrinsic-motivation/blob/HEAD/stable_baselines/common/tf_layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b1b0b13946e3393b","mcp_get_code":{"code_sha256":"b1b0b13946e3393b"}},{"arxiv_id":"2103.17239","paper":"/paper/going-deeper-with-image-transformers","title":"Going deeper with Image Transformers","date":"2021-03-31","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"sayakpaul/cait-tf","path":"cait/models.py","file_url":"https://github.com/sayakpaul/cait-tf/blob/HEAD/cait/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"ae83452001c08f2a","mcp_get_code":{"code_sha256":"ae83452001c08f2a"}},{"arxiv_id":"2103.12057","paper":"/paper/an-experimental-review-on-deep-learning","title":"An Experimental Review on Deep Learning Architectures for Time Series Forecasting","date":"2021-03-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pedrolarben/TimeSeriesForecasting-DeepLearning","path":"experiments/models.py","file_url":"https://github.com/pedrolarben/TimeSeriesForecasting-DeepLearning/blob/HEAD/experiments/models.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"19de8d4c63d65134","mcp_get_code":{"code_sha256":"19de8d4c63d65134"}},{"arxiv_id":"2010.09635","paper":"/paper/deep-reinforcement-learning-with-population","title":"Deep Reinforcement Learning with Population-Coded Spiking Neural Network for Continuous Control","date":"2020-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"combra-lab/pop-spiking-deep-rl","path":"popsan_drl/popsan_sac/core_cuda.py","file_url":"https://github.com/combra-lab/pop-spiking-deep-rl/blob/HEAD/popsan_drl/popsan_sac/core_cuda.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2010.08719","paper":"/paper/a-self-supervised-cascaded-refinement-network","title":"Cascaded Refinement Network for Point Cloud Completion with Self-supervision","date":"2020-10-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xiaogangw/cascaded-point-completion","path":"utils/tf_util.py","file_url":"https://github.com/xiaogangw/cascaded-point-completion/blob/HEAD/utils/tf_util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d7801db447fad2f4","mcp_get_code":{"code_sha256":"d7801db447fad2f4"}},{"arxiv_id":"2007.06709","paper":"/paper/deep-image-orientation-angle-detection","title":"Deep Image Orientation Angle Detection","date":"2020-06-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"pidahbus/deep-image-orientation-angle-detection","path":"layers.py","file_url":"https://github.com/pidahbus/deep-image-orientation-angle-detection/blob/HEAD/layers.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"be7ca88da0c9f87c","mcp_get_code":{"code_sha256":"be7ca88da0c9f87c"}},{"arxiv_id":"2006.12323","paper":"/paper/automatic-recall-machines-internal-replay","title":"Automatic Recall Machines: Internal Replay, Continual Learning and the Brain","date":"2020-06-22","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xu-ji/ARM","path":"code/models/mlp.py","file_url":"https://github.com/xu-ji/ARM/blob/HEAD/code/models/mlp.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c284d36ef4155ddd","mcp_get_code":{"code_sha256":"c284d36ef4155ddd"}},{"arxiv_id":"2006.09359","paper":"/paper/accelerating-online-reinforcement-learning","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","date":"2020-06-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":null,"path":"","file_url":null,"status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":null,"inline_ok":false,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2006.07442","paper":"/paper/self-imitation-learning-via-generalized-lower","title":"Self-Imitation Learning via Generalized Lower Bound Q-learning","date":"2020-06-12","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"openai/spinningup","path":"spinup/algos/pytorch/ddpg/core.py","file_url":"https://github.com/openai/spinningup/blob/HEAD/spinup/algos/pytorch/ddpg/core.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"2006.05576","paper":"/paper/demystifying-self-supervised-learning-an","title":"Self-supervised Learning from a Multi-view Perspective","date":"2020-06-10","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yaohungt/Demystifying_Self_Supervised_Learning","path":"Omniglot/compute_MI_CondEntro.py","file_url":"https://github.com/yaohungt/Demystifying_Self_Supervised_Learning/blob/HEAD/Omniglot/compute_MI_CondEntro.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b509a54eb5ec250b","mcp_get_code":{"code_sha256":"b509a54eb5ec250b"}},{"arxiv_id":"2006.05553","paper":"/paper/neural-methods-for-point-wise-dependency","title":"Neural Methods for Point-wise Dependency Estimation","date":"2020-06-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yaohungt/Pointwise_Dependency_Neural_Estimation","path":"MI_Est_and_CrossModal/src/models.py","file_url":"https://github.com/yaohungt/Pointwise_Dependency_Neural_Estimation/blob/HEAD/MI_Est_and_CrossModal/src/models.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"25d792e8c00de62b","mcp_get_code":{"code_sha256":"25d792e8c00de62b"}},{"arxiv_id":"2004.13649","paper":"/paper/image-augmentation-is-all-you-need","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","date":"2020-04-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xingyu-lin/softagent","path":"drq/Drq.py","file_url":"https://github.com/xingyu-lin/softagent/blob/HEAD/drq/Drq.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"bdef24507a4ccfa7","mcp_get_code":{"code_sha256":"bdef24507a4ccfa7"}},{"arxiv_id":"2002.06815","paper":"/paper/class-imbalanced-semi-supervised-learning","title":"Class-Imbalanced Semi-Supervised Learning","date":"2020-02-17","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MinsungHyun/Class-Imbalanced-Semi-Supervised-Learning","path":"CISSL_cls/lib/mlp.py","file_url":"https://github.com/MinsungHyun/Class-Imbalanced-Semi-Supervised-Learning/blob/HEAD/CISSL_cls/lib/mlp.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2a826909e901934c","mcp_get_code":{"code_sha256":"2a826909e901934c"}},{"arxiv_id":"1911.02116","paper":"/paper/unsupervised-cross-lingual-representation-1","title":"Unsupervised Cross-lingual Representation Learning at Scale","date":"2019-11-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Tikquuss/meta_XLM","path":"XLM/src/model/transformer.py","file_url":"https://github.com/Tikquuss/meta_XLM/blob/HEAD/XLM/src/model/transformer.py","status":"ran_fixture","verification_level":1,"contract_check":"RAISES","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"a05791210b07b83d","mcp_get_code":{"code_sha256":"a05791210b07b83d"}},{"arxiv_id":"1910.07224","paper":"/paper/teacher-algorithms-for-curriculum-learning-of","title":"Teacher algorithms for curriculum learning of Deep RL in continuously parameterized environments","date":"2019-10-16","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"flowersteam/teachDeepRL","path":"teachDRL/spinup/algos/ddpg/core.py","file_url":"https://github.com/flowersteam/teachDeepRL/blob/HEAD/teachDRL/spinup/algos/ddpg/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"1908.02899","paper":"/paper/do-neural-language-representations-learn","title":"Do Neural Language Representations Learn Physical Commonsense?","date":"2019-08-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mbforbes/physical-commonsense","path":"pc/models.py","file_url":"https://github.com/mbforbes/physical-commonsense/blob/HEAD/pc/models.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"040799bb98fb58f2","mcp_get_code":{"code_sha256":"040799bb98fb58f2"}},{"arxiv_id":"1906.01401","paper":"/paper/unsupervised-emergence-of-egocentric-spatial","title":"Unsupervised Emergence of Egocentric Spatial Structure from Sensorimotor Prediction","date":"2019-06-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"alaflaquiere/learn-spatial-structure","path":"Networks.py","file_url":"https://github.com/alaflaquiere/learn-spatial-structure/blob/HEAD/Networks.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2420edc5273f2b91","mcp_get_code":{"code_sha256":"2420edc5273f2b91"}},{"arxiv_id":"1905.01240","paper":"/paper/information-asymmetry-in-kl-regularized-rl-1","title":"Information asymmetry in KL-regularized RL","date":"2019-05-03","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RobvanGastel/svg-priors","path":"utils/misc.py","file_url":"https://github.com/RobvanGastel/svg-priors/blob/HEAD/utils/misc.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"7569e2a512ec417c","mcp_get_code":{"code_sha256":"7569e2a512ec417c"}},{"arxiv_id":"1812.10613","paper":"/paper/generative-adversarial-user-model-for","title":"Generative Adversarial User Model for Reinforcement Learning Based Recommendation System","date":"2018-12-27","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"xinshi-chen/GenerativeAdversarialUserModel","path":"ganrl/experiment_user_model/utils.py","file_url":"https://github.com/xinshi-chen/GenerativeAdversarialUserModel/blob/HEAD/ganrl/experiment_user_model/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b17c545361c395ea","mcp_get_code":{"code_sha256":"b17c545361c395ea"}},{"arxiv_id":"1812.05905","paper":"/paper/soft-actor-critic-algorithms-and-applications","title":"Soft Actor-Critic Algorithms and Applications","date":"2018-12-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"willwhitney/pytorch_sac_lib","path":"sac_utils.py","file_url":"https://github.com/willwhitney/pytorch_sac_lib/blob/HEAD/sac_utils.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"db00dda8b96201d3","mcp_get_code":{"code_sha256":"db00dda8b96201d3"}},{"arxiv_id":"1812.02690","paper":"/paper/provably-efficient-maximum-entropy","title":"Provably Efficient Maximum Entropy Exploration","date":"2018-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"abbyvansoest/maxent","path":"core.py","file_url":"https://github.com/abbyvansoest/maxent/blob/HEAD/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"1809.08835","paper":"/paper/crowd-robot-interaction-crowd-aware-robot","title":"Crowd-Robot Interaction: Crowd-aware Robot Navigation with Attention-based Deep Reinforcement Learning","date":"2018-09-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"vita-epfl/CrowdNav","path":"crowd_nav/policy/cadrl.py","file_url":"https://github.com/vita-epfl/CrowdNav/blob/HEAD/crowd_nav/policy/cadrl.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"41b3a883a96e7454","mcp_get_code":{"code_sha256":"41b3a883a96e7454"}},{"arxiv_id":"1808.00671","paper":"/paper/pcn-point-completion-network","title":"PCN: Point Completion Network","date":"2018-08-02","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wentaoyuan/pcn","path":"tf_util.py","file_url":"https://github.com/wentaoyuan/pcn/blob/HEAD/tf_util.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"873d33260cb6137a","mcp_get_code":{"code_sha256":"873d33260cb6137a"}},{"arxiv_id":"1805.09801","paper":"/paper/meta-gradient-reinforcement-learning","title":"Meta-Gradient Reinforcement Learning","date":"2018-05-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"RobvanGastel/meta-rl-algorithms","path":"utils/misc.py","file_url":"https://github.com/RobvanGastel/meta-rl-algorithms/blob/HEAD/utils/misc.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"6686f013f3e2c3bf","mcp_get_code":{"code_sha256":"6686f013f3e2c3bf"}},{"arxiv_id":"1802.09477","paper":"/paper/addressing-function-approximation-error-in","title":"Addressing Function Approximation Error in Actor-Critic Methods","date":"2018-02-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"robintyh1/icml2021-pengqlambda","path":"spinup/algos/tf1/td3_peng/core.py","file_url":"https://github.com/robintyh1/icml2021-pengqlambda/blob/HEAD/spinup/algos/tf1/td3_peng/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"tmjeong1103/RL_with_RAY","path":"SAC_RAY/model.py","file_url":"https://github.com/tmjeong1103/RL_with_RAY/blob/HEAD/SAC_RAY/model.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"a1e9dc4773ffeba5","mcp_get_code":{"code_sha256":"a1e9dc4773ffeba5"}},{"arxiv_id":"1801.01290","paper":"/paper/soft-actor-critic-off-policy-maximum-entropy","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","date":"2018-01-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"watchernyu/spinningup-drl-prototyping","path":"spinup/algos/sac/core.py","file_url":"https://github.com/watchernyu/spinningup-drl-prototyping/blob/HEAD/spinup/algos/sac/core.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e68b07bcdded00fa","mcp_get_code":{"code_sha256":"e68b07bcdded00fa"}},{"arxiv_id":"1703.03400","paper":"/paper/model-agnostic-meta-learning-for-fast","title":"Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks","date":"2017-03-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"MaximeVandegar/Papers-in-100-Lines-of-Code","path":"Model_Agnostic_Meta_Learning_for_Fast_Adaptation_of_Deep_Networks/maml.py","file_url":"https://github.com/MaximeVandegar/Papers-in-100-Lines-of-Code/blob/HEAD/Model_Agnostic_Meta_Learning_for_Fast_Adaptation_of_Deep_Networks/maml.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"invariant","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e78a9a3c93b39d53","mcp_get_code":{"code_sha256":"e78a9a3c93b39d53"}},{"arxiv_id":"1611.02779","paper":"/paper/rl2-fast-reinforcement-learning-via-slow","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","date":"2016-11-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"aliengirlliv/teachable","path":"algos/ppo.py","file_url":"https://github.com/aliengirlliv/teachable/blob/HEAD/algos/ppo.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"OUTPUT_MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"e26d482acf579f3e","mcp_get_code":{"code_sha256":"e26d482acf579f3e"}},{"arxiv_id":"0705.2011","paper":"/paper/multi-dimensional-recurrent-neural-networks","title":"Multi-Dimensional Recurrent Neural Networks","date":"2007-05-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jzbjyb/rri_match","path":"cnn.py","file_url":"https://github.com/jzbjyb/rri_match/blob/HEAD/cnn.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"6fb3d9e6ce59a987","mcp_get_code":{"code_sha256":"6fb3d9e6ce59a987"}}]}