{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/zeropower-via-newtonschulz5","entry":"zeropower_via_newtonschulz5","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":24,"n_papers_ran":13,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":27,"n_samples_ran":9,"n_samples_fingerprinted":9,"n_places":34,"n_places_pointer_only":8,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":3,"ran_fixture":0,"ran":6,"unverified":18},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2609.14715","paper":"/paper/arxiv-2609-14715","title":"Depth and Scale in the Sub-150M Regime: JugnuLM-53M vs JugnuLM-110M","date":null,"month_inferred_from_arxiv_id":"2026-09","title_source":"syntology","repo":"AltSlate-Labs/jugnu","path":"muon.py","file_url":"https://github.com/AltSlate-Labs/jugnu/blob/HEAD/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"c8c6c22862b64a4d","mcp_get_code":{"code_sha256":"c8c6c22862b64a4d"}},{"arxiv_id":"2608.26973","paper":"/paper/arxiv-2608-26973","title":"Squeezing More from Limited Data with Recursive Transformers","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"serdardoesml/recursive-lm","path":"recursive_lm/optimizer.py","file_url":"https://github.com/serdardoesml/recursive-lm/blob/HEAD/recursive_lm/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b7f41e9dfacd5ee3","mcp_get_code":{"code_sha256":"b7f41e9dfacd5ee3"}},{"arxiv_id":"2608.22994","paper":"/paper/arxiv-2608-22994","title":"A Physical Response-and-Memory Model for Muon Optimization","date":null,"month_inferred_from_arxiv_id":"2026-08","title_source":"syntology","repo":"orange4664/bimaxwell-track3-reproduction","path":"record_2635_submission/train_gpt_bimaxwell_2635.py","file_url":"https://github.com/orange4664/bimaxwell-track3-reproduction/blob/HEAD/record_2635_submission/train_gpt_bimaxwell_2635.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c9dd31c1e98b4ebf","mcp_get_code":{"code_sha256":"c9dd31c1e98b4ebf"}},{"arxiv_id":"2606.27361","paper":"/paper/arxiv-2606-27361","title":"Autoregressive Boltzmann Generators","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"danyalrehman/autobg","path":"src/optimizers/muon.py","file_url":"https://github.com/danyalrehman/autobg/blob/HEAD/src/optimizers/muon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"227822d98406033b","mcp_get_code":{"code_sha256":"227822d98406033b"}},{"arxiv_id":"2606.14187","paper":"/paper/arxiv-2606-14187","title":"Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"AIGCodeOS/aigcode_zeta_optimizer","path":"megatron/core/optimizer/adamuon.py","file_url":"https://github.com/AIGCodeOS/aigcode_zeta_optimizer/blob/HEAD/megatron/core/optimizer/adamuon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"0c0438262f800460","mcp_get_code":{"code_sha256":"0c0438262f800460"}},{"arxiv_id":"2606.14187","paper":"/paper/arxiv-2606-14187","title":"Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning","date":null,"month_inferred_from_arxiv_id":"2026-06","title_source":"syntology","repo":"AIGCodeOS/aigcode_zeta_optimizer","path":"megatron/core/optimizer/mixmuon.py","file_url":"https://github.com/AIGCodeOS/aigcode_zeta_optimizer/blob/HEAD/megatron/core/optimizer/mixmuon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NOASSERTION","inline_ok":false,"code_sha256_prefix":"a097b474f96888d8","mcp_get_code":{"code_sha256":"a097b474f96888d8"}},{"arxiv_id":"2605.31463","paper":"/paper/arxiv-2605-31463","title":"PithTrain: A Compact and Agent-Native MoE Training System","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"mlc-ai/pith-train","path":"pithtrain/modules/optimizer.py","file_url":"https://github.com/mlc-ai/pith-train/blob/HEAD/pithtrain/modules/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f1822f08ab8bef43","mcp_get_code":{"code_sha256":"f1822f08ab8bef43"}},{"arxiv_id":"2605.22297","paper":"/paper/arxiv-2605-22297","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"hed-ucas/Layer-wise-Learning-Rate","path":"galore_utils/muon.py","file_url":"https://github.com/hed-ucas/Layer-wise-Learning-Rate/blob/HEAD/galore_utils/muon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"88b19bfaad9384f8","mcp_get_code":{"code_sha256":"88b19bfaad9384f8"}},{"arxiv_id":"2605.19811","paper":"/paper/arxiv-2605-19811","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"brain-lab-research/lion-muon","path":"src/optim/muon.py","file_url":"https://github.com/brain-lab-research/lion-muon/blob/HEAD/src/optim/muon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"04049769e4eed44a","mcp_get_code":{"code_sha256":"04049769e4eed44a"}},{"arxiv_id":"2605.17109","paper":"/paper/arxiv-2605-17109","title":"DynMuon: A Dynamic Spectral Shaping View of Muon","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"fzwark/DynMuon","path":"dynmuon/muon_reference.py","file_url":"https://github.com/fzwark/DynMuon/blob/HEAD/dynmuon/muon_reference.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"2c92c3e5770228d4","mcp_get_code":{"code_sha256":"2c92c3e5770228d4"}},{"arxiv_id":"2605.17109","paper":"/paper/arxiv-2605-17109","title":"DynMuon: A Dynamic Spectral Shaping View of Muon","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"fzwark/DynMuon","path":"dynmuon/newton_schulz_triton.py","file_url":"https://github.com/fzwark/DynMuon/blob/HEAD/dynmuon/newton_schulz_triton.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"fbcadf5bf33cd8bd","mcp_get_code":{"code_sha256":"fbcadf5bf33cd8bd"}},{"arxiv_id":"2605.13687","paper":"/paper/arxiv-2605-13687","title":"A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"joonhyungshin/nanocontext","path":"nanocontext/optim/muon.py","file_url":"https://github.com/joonhyungshin/nanocontext/blob/HEAD/nanocontext/optim/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"053ca60c81f1dfff","mcp_get_code":{"code_sha256":"053ca60c81f1dfff"}},{"arxiv_id":"2605.09991","paper":"/paper/arxiv-2605-09991","title":"Optimizer-Induced Mode Connectivity: From AdamW to Muon","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"KellerJordan/Muon","path":"muon.py","file_url":"https://github.com/KellerJordan/Muon/blob/HEAD/muon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88b19bfaad9384f8","mcp_get_code":{"code_sha256":"88b19bfaad9384f8"}},{"arxiv_id":"2605.06884","paper":"/paper/arxiv-2605-06884","title":"Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition","date":null,"month_inferred_from_arxiv_id":"2026-05","title_source":"syntology","repo":"Xiaoran-Cheng/muon-randomized-svd","path":"cifar10/research/airbench94_muon_simple.py","file_url":"https://github.com/Xiaoran-Cheng/muon-randomized-svd/blob/HEAD/cifar10/research/airbench94_muon_simple.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f3ac1549c0a496f4","mcp_get_code":{"code_sha256":"f3ac1549c0a496f4"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_3_optimization/train_gpt_simple.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_3_optimization/train_gpt_simple.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f21c15e79f628ed4","mcp_get_code":{"code_sha256":"f21c15e79f628ed4"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_1_short/2024-10-10_Muon/train_gpt2.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_1_short/2024-10-10_Muon/train_gpt2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"5728875012ffc26a","mcp_get_code":{"code_sha256":"5728875012ffc26a"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_1_short/2024-10-14_ModernArch/train_gpt2.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_1_short/2024-10-14_ModernArch/train_gpt2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"063edbb4688922ba","mcp_get_code":{"code_sha256":"063edbb4688922ba"}},{"arxiv_id":"2604.01472","paper":"/paper/arxiv-2604-01472","title":"The Newton-Muon Optimizer","date":null,"month_inferred_from_arxiv_id":"2026-04","title_source":"syntology","repo":"KellerJordan/modded-nanogpt","path":"records/track_1_short/2024-12-04_ValueEmbed/train_gpt2.py","file_url":"https://github.com/KellerJordan/modded-nanogpt/blob/HEAD/records/track_1_short/2024-12-04_ValueEmbed/train_gpt2.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"52f6a37650968e45","mcp_get_code":{"code_sha256":"52f6a37650968e45"}},{"arxiv_id":"2602.17155","paper":"/paper/arxiv-2602-17155","title":"Powering Up Zeroth-Order Training via Subspace Gradient Orthogonalization","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"OPTML-Group/ZO-Muon","path":"llm/LowDimTrainer.py","file_url":"https://github.com/OPTML-Group/ZO-Muon/blob/HEAD/llm/LowDimTrainer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"635c93a80a199840","mcp_get_code":{"code_sha256":"635c93a80a199840"}},{"arxiv_id":"2602.17080","paper":"/paper/arxiv-2602-17080","title":"Adam Improves Muon Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"minxin-zhg/namo","path":"src/namo.py","file_url":"https://github.com/minxin-zhg/namo/blob/HEAD/src/namo.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6cbb0406b3d2e05","mcp_get_code":{"code_sha256":"c6cbb0406b3d2e05"}},{"arxiv_id":"2602.14656","paper":"/paper/arxiv-2602-14656","title":"An Embarrassingly Simple Way to Optimize Orthogonal Matrices at Scale","date":null,"month_inferred_from_arxiv_id":"2026-02","title_source":"syntology","repo":"KellerJordan/cifar10-airbench","path":"airbench94_muon.py","file_url":"https://github.com/KellerJordan/cifar10-airbench/blob/HEAD/airbench94_muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"80efc3fcf6a79899","mcp_get_code":{"code_sha256":"80efc3fcf6a79899"}},{"arxiv_id":"2601.14603","paper":"/paper/arxiv-2601-14603","title":"Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"jingru-lee/Variance-Adaptive-Muon","path":"Suite_A/src/optim/muon.py","file_url":"https://github.com/jingru-lee/Variance-Adaptive-Muon/blob/HEAD/Suite_A/src/optim/muon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"04049769e4eed44a","mcp_get_code":{"code_sha256":"04049769e4eed44a"}},{"arxiv_id":"2601.14603","paper":"/paper/arxiv-2601-14603","title":"Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"jingru-lee/Variance-Adaptive-Muon","path":"Suite_B/muon.py","file_url":"https://github.com/jingru-lee/Variance-Adaptive-Muon/blob/HEAD/Suite_B/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"bf190c2d81f45aa9","mcp_get_code":{"code_sha256":"bf190c2d81f45aa9"}},{"arxiv_id":"2601.14603","paper":"/paper/arxiv-2601-14603","title":"Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"jingru-lee/Variance-Adaptive-Muon","path":"Suite_B/muon_nsr.py","file_url":"https://github.com/jingru-lee/Variance-Adaptive-Muon/blob/HEAD/Suite_B/muon_nsr.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"901cfa8d98a949c5","mcp_get_code":{"code_sha256":"901cfa8d98a949c5"}},{"arxiv_id":"2601.14603","paper":"/paper/arxiv-2601-14603","title":"Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum","date":null,"month_inferred_from_arxiv_id":"2026-01","title_source":"syntology","repo":"jingru-lee/Variance-Adaptive-Muon","path":"Suite_A/src/optim/muon_vs.py","file_url":"https://github.com/jingru-lee/Variance-Adaptive-Muon/blob/HEAD/Suite_A/src/optim/muon_vs.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"72f7d6d5b8308b8e","mcp_get_code":{"code_sha256":"72f7d6d5b8308b8e"}},{"arxiv_id":"2512.07112","paper":"/paper/arxiv-2512-07112","title":"FOAM: Blocked State Folding for Memory-Efficient LLM Training","date":null,"month_inferred_from_arxiv_id":"2025-12","title_source":"syntology","repo":"zqOuO/FOAM","path":"foam_torch/muon.py","file_url":"https://github.com/zqOuO/FOAM/blob/HEAD/foam_torch/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"c6cbb0406b3d2e05","mcp_get_code":{"code_sha256":"c6cbb0406b3d2e05"}},{"arxiv_id":"2510.05491","paper":"/paper/arxiv-2510-05491","title":"NorMuon: Making Muon more efficient and scalable","date":null,"month_inferred_from_arxiv_id":"2025-10","title_source":"syntology","repo":"zichongli5/NorMuon","path":"normuon.py","file_url":"https://github.com/zichongli5/NorMuon/blob/HEAD/normuon.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b7f41e9dfacd5ee3","mcp_get_code":{"code_sha256":"b7f41e9dfacd5ee3"}},{"arxiv_id":"2508.20577","paper":"/paper/arxiv-2508-20577","title":"MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training","date":null,"month_inferred_from_arxiv_id":"2025-08","title_source":"syntology","repo":"kyleliang919/C-Optim","path":"c_muon.py","file_url":"https://github.com/kyleliang919/C-Optim/blob/HEAD/c_muon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88b19bfaad9384f8","mcp_get_code":{"code_sha256":"88b19bfaad9384f8"}},{"arxiv_id":"2507.11005","paper":"/paper/adamuon-adaptive-muon-optimizer","title":"AdaMuon: Adaptive Muon Optimizer","date":"2025-07-15","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Chongjie-Si/AdaMuon","path":"adamuon.py","file_url":"https://github.com/Chongjie-Si/AdaMuon/blob/HEAD/adamuon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":"deterministic","behaviour_fingerprint":true,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"5618cdee336eee9f","mcp_get_code":{"code_sha256":"5618cdee336eee9f"}},{"arxiv_id":"2502.07529","paper":"/paper/training-deep-learning-models-with-norm","title":"Training Deep Learning Models with Norm-Constrained LMOs","date":"2025-02-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lions-epfl/scion","path":"scion.py","file_url":"https://github.com/lions-epfl/scion/blob/HEAD/scion.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"ebf4909ddc522784","mcp_get_code":{"code_sha256":"ebf4909ddc522784"}},{"arxiv_id":"2502.07529","paper":"/paper/training-deep-learning-models-with-norm","title":"Training Deep Learning Models with Norm-Constrained LMOs","date":"2025-02-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"LunNova/ScionLight-reimpl","path":"scionlight.py","file_url":"https://github.com/LunNova/ScionLight-reimpl/blob/HEAD/scionlight.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"242fd0f7cbb63b14","mcp_get_code":{"code_sha256":"242fd0f7cbb63b14"}},{"arxiv_id":"2411.16085","paper":"/paper/cautious-optimizers-improving-training-with","title":"Cautious Optimizers: Improving Training with One Line of Code","date":"2024-11-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kyleliang919/c-optim","path":"c_muon.py","file_url":"https://github.com/kyleliang919/c-optim/blob/HEAD/c_muon.py","status":"ran_draft_wrong","verification_level":1,"contract_check":"MISDECLARED","metamorphic_tier":null,"behaviour_fingerprint":true,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"88b19bfaad9384f8","mcp_get_code":{"code_sha256":"88b19bfaad9384f8"}},{"arxiv_id":"2411.16085","paper":"/paper/cautious-optimizers-improving-training-with","title":"Cautious Optimizers: Improving Training with One Line of Code","date":"2024-11-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"kyleliang919/c-optim","path":"muon.py","file_url":"https://github.com/kyleliang919/c-optim/blob/HEAD/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"c6cbb0406b3d2e05","mcp_get_code":{"code_sha256":"c6cbb0406b3d2e05"}},{"arxiv_id":"2104.06546","paper":"/paper/large-scale-contextualised-language-modelling","title":"Large-Scale Contextualised Language Modelling for Norwegian","date":"2021-04-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ltgoslo/NorBERT","path":"norbert4/muon.py","file_url":"https://github.com/ltgoslo/NorBERT/blob/HEAD/norbert4/muon.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"CC0-1.0","inline_ok":true,"code_sha256_prefix":"c98301effef79e18","mcp_get_code":{"code_sha256":"c98301effef79e18"}}]}