{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/code/set-weight-decay","entry":"set_weight_decay","source":"Syntology graph, per-sample; not an archive number","read_at":"2026-09-24T18:15:14+00:00","claim":"Names are grouped by exact entry-name string. Same-named routines are NOT asserted to be equivalent; 'ran' means executed on a synthesized fixture, not correctness. n_samples_ran = sum of by_status over every status except 'unverified' (ran_draft_wrong and ran_fixture are failures of Syntology's instrument, not of the code); n_papers_ran = papers with at least one such sample.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"},"n_papers":32,"n_papers_ran":21,"units":"n_samples, n_samples_ran, n_samples_fingerprinted and by_status count distinct code bodies (code_sha256); n_places and n_places_pointer_only count places, one per (paper, code body) pair, which is also the unit of the samples list","n_samples":13,"n_samples_ran":4,"n_samples_fingerprinted":0,"n_places":32,"n_places_pointer_only":12,"by_status":{"ran_honours":0,"ran_violates":0,"ran_draft_wrong":0,"ran_fixture":0,"ran":4,"unverified":9},"syntology":{"atlas_url":null,"mcp":null,"mcp_per_sample":{"tool":"get_code","arguments_in":"samples[].mcp_get_code"},"developers":"https://syntology.ai/developers"},"samples":[{"arxiv_id":"2411.01800","paper":"/paper/expanding-sparse-tuning-for-low-memory-usage","title":"Expanding Sparse Tuning for Low Memory Usage","date":"2024-11-04","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ssfgunner/SNELL","path":"lib/utils.py","file_url":"https://github.com/ssfgunner/SNELL/blob/HEAD/lib/utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b3b2e6a0853dff09","mcp_get_code":{"code_sha256":"b3b2e6a0853dff09"}},{"arxiv_id":"2410.15091","paper":"/paper/spatial-mamba-effective-visual-state-space","title":"Spatial-Mamba: Effective Visual State Space Models via Structure-Aware State Fusion","date":"2024-10-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"edwardchasel/spatial-mamba","path":"classification/utils/optimizer.py","file_url":"https://github.com/edwardchasel/spatial-mamba/blob/HEAD/classification/utils/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d5473f673967c35","mcp_get_code":{"code_sha256":"2d5473f673967c35"}},{"arxiv_id":"2407.19394","paper":"/paper/depth-wise-convolutions-in-vision","title":"Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets","date":"2024-07-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ztx-100/efficient_vit_with_dw","path":"optimizer.py","file_url":"https://github.com/ztx-100/efficient_vit_with_dw/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2406.08773","paper":"/paper/denoisereid-denoising-model-for","title":"DenoiseRep: Denoising Model for Representation Learning","date":"2024-06-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"wangguanan/DenoiseRep","path":"Classification/imagenet/Swin-Transformer/optimizer.py","file_url":"https://github.com/wangguanan/DenoiseRep/blob/HEAD/Classification/imagenet/Swin-Transformer/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2405.16466","paper":"/paper/high-performance-temporal-reversible-spiking","title":"High-Performance Temporal Reversible Spiking Neural Networks with $O(L)$ Training Memory and $O(1)$ Inference Cost","date":"2024-05-26","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"biclab/t-revsnn","path":"optimizer.py","file_url":"https://github.com/biclab/t-revsnn/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"5dd42a7ce2cea5bd","mcp_get_code":{"code_sha256":"5dd42a7ce2cea5bd"}},{"arxiv_id":"2405.11770","paper":"/paper/learning-spatial-similarity-distribution-for","title":"Learning Spatial Similarity Distribution for Few-shot Object Counting","date":"2024-05-20","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"CBalance/SSD","path":"optimizer.py","file_url":"https://github.com/CBalance/SSD/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2405.05808","paper":"/paper/fast-and-controllable-post-training-sparsity","title":"Fast and Controllable Post-training Sparsity: Learning Optimal Sparsity Allocation with Global Constraint in Minutes","date":"2024-05-09","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ModelTC/FCPTS","path":"train/optimizer.py","file_url":"https://github.com/ModelTC/FCPTS/blob/HEAD/train/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"284f23322c9df1e7","mcp_get_code":{"code_sha256":"284f23322c9df1e7"}},{"arxiv_id":"2404.07794","paper":"/paper/dgmamba-domain-generalization-via-generalized","title":"DGMamba: Domain Generalization via Generalized State Space Model","date":"2024-04-11","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"longshaocong/dgmamba","path":"utils/optimizer.py","file_url":"https://github.com/longshaocong/dgmamba/blob/HEAD/utils/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"2d5473f673967c35","mcp_get_code":{"code_sha256":"2d5473f673967c35"}},{"arxiv_id":"2311.04442","paper":"/paper/ss-mae-spatial-spectral-masked-auto-encoder","title":"SS-MAE: Spatial-Spectral Masked Auto-Encoder for Multi-Source Remote Sensing Image Classification","date":"2023-11-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"summitgao/ss-mae","path":"utils/optimizer_step.py","file_url":"https://github.com/summitgao/ss-mae/blob/HEAD/utils/optimizer_step.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2310.15165","paper":null,"title":"arXiv:2310.15165","date":null,"month_inferred_from_arxiv_id":"2023-10","title_source":null,"repo":"sarapieri/fed_het","path":"utils/util.py","file_url":"https://github.com/sarapieri/fed_het/blob/HEAD/utils/util.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2309.16298","paper":"/paper/at-which-training-stage-does-cocde-data-help","title":"At Which Training Stage Does Code Data Help LLMs Reasoning?","date":"2023-09-28","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yingweima2022/codellm","path":"instruction_following.py","file_url":"https://github.com/yingweima2022/codellm/blob/HEAD/instruction_following.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"f12f9486ba2960e6","mcp_get_code":{"code_sha256":"f12f9486ba2960e6"}},{"arxiv_id":"2309.02772","paper":"/paper/improving-code-generation-by-dynamic","title":"Hot or Cold? Adaptive Temperature Sampling for Code Generation with Large Language Models","date":"2023-09-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"lj2lijia/adapt","path":"codegeex/mindspore/finetune.py","file_url":"https://github.com/lj2lijia/adapt/blob/HEAD/codegeex/mindspore/finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f12f9486ba2960e6","mcp_get_code":{"code_sha256":"f12f9486ba2960e6"}},{"arxiv_id":"2307.06947","paper":"/paper/video-focalnets-spatio-temporal-focal","title":"Video-FocalNets: Spatio-Temporal Focal Modulation for Video Action Recognition","date":"2023-07-13","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"talalwasim/video-focalnets","path":"optimizer.py","file_url":"https://github.com/talalwasim/video-focalnets/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"NONE","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2306.05175","paper":"/paper/large-scale-dataset-pruning-with-dynamic","title":"Large-scale Dataset Pruning with Dynamic Uncertainty","date":"2023-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"baai-dcai/dataset-pruning","path":"ImageNet/optimizer.py","file_url":"https://github.com/baai-dcai/dataset-pruning/blob/HEAD/ImageNet/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2304.12043","paper":"/paper/mixpro-data-augmentation-with-maskmix-and","title":"MixPro: Data Augmentation with MaskMix and Progressive Attention Labeling for Vision Transformer","date":"2023-04-24","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"fistyee/MixPro","path":"optimizer.py","file_url":"https://github.com/fistyee/MixPro/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2303.17568","paper":"/paper/codegeex-a-pre-trained-model-for-code","title":"CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X","date":"2023-03-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"THUDM/CodeGeeX","path":"codegeex/mindspore/finetune.py","file_url":"https://github.com/THUDM/CodeGeeX/blob/HEAD/codegeex/mindspore/finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"f12f9486ba2960e6","mcp_get_code":{"code_sha256":"f12f9486ba2960e6"}},{"arxiv_id":"2303.11525","paper":"/paper/sift-sparse-iso-flop-transformations-for","title":"Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency","date":"2023-03-21","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"cerebrasresearch/sift","path":"ComputerVision/ImageNet/utils/optim_utils.py","file_url":"https://github.com/cerebrasresearch/sift/blob/HEAD/ComputerVision/ImageNet/utils/optim_utils.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"87e81f47b5aefd7c","mcp_get_code":{"code_sha256":"87e81f47b5aefd7c"}},{"arxiv_id":"2212.03640","paper":"/paper/fine-tuned-clip-models-are-efficient-video","title":"Fine-tuned CLIP Models are Efficient Video Learners","date":"2022-12-06","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"muzairkhattak/vifi-clip","path":"utils/optimizer.py","file_url":"https://github.com/muzairkhattak/vifi-clip/blob/HEAD/utils/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"883e1ab4ad47ea2d","mcp_get_code":{"code_sha256":"883e1ab4ad47ea2d"}},{"arxiv_id":"2207.09455","paper":"/paper/to-update-or-not-to-update-neurons-at","title":"To update or not to update? Neurons at equilibrium in deep models","date":"2022-07-19","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"eidoslab/neq","path":"src/Swin-Transformer/optimizer.py","file_url":"https://github.com/eidoslab/neq/blob/HEAD/src/Swin-Transformer/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"d54a6d0b660e3b69","mcp_get_code":{"code_sha256":"d54a6d0b660e3b69"}},{"arxiv_id":"2205.14922","paper":"/paper/acil-analytic-class-incremental-learning-with","title":"ACIL: Analytic Class-Incremental Learning with Absolute Memorization and Privacy Protection","date":"2022-05-30","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"ZHUANGHP/Analytic-continual-learning","path":"analytic/ACIL.py","file_url":"https://github.com/ZHUANGHP/Analytic-continual-learning/blob/HEAD/analytic/ACIL.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"515618290aea20f8","mcp_get_code":{"code_sha256":"515618290aea20f8"}},{"arxiv_id":"2203.02751","paper":"/paper/metaformer-a-unified-meta-framework-for-fine","title":"MetaFormer: A Unified Meta Framework for Fine-Grained Recognition","date":"2022-03-05","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"dqshuai/metaformer","path":"optimizer.py","file_url":"https://github.com/dqshuai/metaformer/blob/HEAD/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"eac7e5fdc70e5cc9","mcp_get_code":{"code_sha256":"eac7e5fdc70e5cc9"}},{"arxiv_id":"2202.06510","paper":"/paper/mixing-and-shifting-exploiting-global-and","title":"Mixing and Shifting: Exploiting Global and Local Dependencies in Vision MLPs","date":"2022-02-14","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"jegzheng/ms-mlp","path":"optimizer.py","file_url":"https://github.com/jegzheng/ms-mlp/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2107.08391","paper":"/paper/as-mlp-an-axial-shifted-mlp-architecture-for","title":"AS-MLP: An Axial Shifted MLP Architecture for Vision","date":"2021-07-18","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"svip-lab/AS-MLP","path":"optimizer.py","file_url":"https://github.com/svip-lab/AS-MLP/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2106.04263","paper":"/paper/demystifying-local-vision-transformer-sparse","title":"On the Connection between Local Attention and Dynamic Depth-wise Convolution","date":"2021-06-08","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"Atten4Vis/DemystifyLocalViT","path":"optimizer.py","file_url":"https://github.com/Atten4Vis/DemystifyLocalViT/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2106.03746","paper":"/paper/efficient-training-of-visual-transformers","title":"Efficient Training of Visual Transformers with Small Datasets","date":"2021-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"yhlleo/VTs-Drloc","path":"optimizer.py","file_url":"https://github.com/yhlleo/VTs-Drloc/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2106.03650","paper":"/paper/shuffle-transformer-rethinking-spatial","title":"Shuffle Transformer: Rethinking Spatial Shuffle for Vision Transformer","date":"2021-06-07","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"mulinmeng/Shuffle-Transformer","path":"optimizer.py","file_url":"https://github.com/mulinmeng/Shuffle-Transformer/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"2103.14030","paper":"/paper/swin-transformer-hierarchical-vision","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","date":"2021-03-25","month_inferred_from_arxiv_id":null,"title_source":"archive","repo":"canerozer/qct","path":"optimizer.py","file_url":"https://github.com/canerozer/qct/blob/HEAD/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"ijcai2025_0271","paper":null,"title":"arXiv:ijcai2025_0271","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"ZheminZhang1/HcNet","path":"HcNet/optimizer.py","file_url":"https://github.com/ZheminZhang1/HcNet/blob/HEAD/HcNet/optimizer.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"b33222a09fc93bec","mcp_get_code":{"code_sha256":"b33222a09fc93bec"}},{"arxiv_id":"ijcai2023_0504","paper":null,"title":"arXiv:ijcai2023_0504","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"Markin-Wang/CLEViT","path":"optimizer.py","file_url":"https://github.com/Markin-Wang/CLEViT/blob/HEAD/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":false,"code_sha256_prefix":"78862c82805c0e53","mcp_get_code":{"code_sha256":"78862c82805c0e53"}},{"arxiv_id":"aaai_27798","paper":null,"title":"arXiv:aaai_27798","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"LJ2lijia/AdapT","path":"codegeex/mindspore/finetune.py","file_url":"https://github.com/LJ2lijia/AdapT/blob/HEAD/codegeex/mindspore/finetune.py","status":"ran","verification_level":1,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"f12f9486ba2960e6","mcp_get_code":{"code_sha256":"f12f9486ba2960e6"}},{"arxiv_id":"Xie_PVMamba_Parallelizing_Vision_Mamba_via_Dynamic_State_Aggregation_ICCV_2025_paper","paper":null,"title":"arXiv:Xie_PVMamba_Parallelizing_Vision_Mamba_via_Dynamic_State_Aggregation_ICCV_2025_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"VISION-SJTU/PVMamba","path":"classification/utils/optimizer.py","file_url":"https://github.com/VISION-SJTU/PVMamba/blob/HEAD/classification/utils/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"code_sha256_prefix":"2d5473f673967c35","mcp_get_code":{"code_sha256":"2d5473f673967c35"}},{"arxiv_id":"Gao_Bootstrapping_SparseFormers_from_Vision_Foundation_Models_CVPR_2024_paper","paper":null,"title":"arXiv:Gao_Bootstrapping_SparseFormers_from_Vision_Foundation_Models_CVPR_2024_paper","date":null,"month_inferred_from_arxiv_id":null,"title_source":null,"repo":"showlab/sparseformer","path":"imagenet/optimizer.py","file_url":"https://github.com/showlab/sparseformer/blob/HEAD/imagenet/optimizer.py","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"code_sha256_prefix":"a71abeaf668b91d6","mcp_get_code":{"code_sha256":"a71abeaf668b91d6"}}]}