{"url":"/method/step-decay","slug":"step-decay","name":"Step Decay","full_name":"Step Decay","full_name_withheld":false,"description_markdown":"**Step Decay** is a learning rate schedule that drops the learning rate by a factor every few epochs, where the number of epochs is a hyperparameter.\r\n\r\nImage Credit: [Suki Lau](https://towardsdatascience.com/learning-rate-schedules-and-adaptive-learning-rate-methods-for-deep-learning-2c8f433990d1)","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Learning Rate Schedules","url":"/methods/category/learning-rate-schedules","pwc_aliases":[]}],"n_papers_tagged":73,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/a-multi-power-law-for-loss-curve-prediction","title":"A Multi-Power Law for Loss Curve Prediction Across Learning Rate Schedules","date":"2025-03-17","arxiv_id":"2503.12811","n_code_links":1,"syntology":{"ran":0,"of":9,"unverified":9,"pointer_only":0}},{"paper":"/paper/regularized-xception-for-facial-expression","title":"Regularized Xception for facial expression recognition with extra training data and step decay learning rate","date":"2024-10-17","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"title":"Accelerated Convergence of Stochastic Heavy Ball Method under Anisotropic Gradient Noise","date":"2023-12-22","arxiv_id":"2312.14567","n_code_links":0,"syntology":null},{"paper":null,"title":"DDGM: Solving inverse problems by Diffusive Denoising of Gradient-based Minimization","date":"2023-07-11","arxiv_id":"2307.04946","n_code_links":0,"syntology":null},{"paper":null,"title":"Gradient Descent, Stochastic Optimization, and Other Tales","date":"2022-05-02","arxiv_id":"2205.00832","n_code_links":0,"syntology":null},{"paper":"/paper/eigencurve-optimal-learning-rate-schedule-for-1","title":"Eigencurve: Optimal Learning Rate Schedule for SGD on Quadratic Objectives with Skewed Hessian Spectrums","date":"2021-10-27","arxiv_id":"2110.14109","n_code_links":1,"syntology":null},{"paper":"/paper/rex-revisiting-budgeted-training-with-an","title":"REX: Revisiting Budgeted Training with an Improved Schedule","date":"2021-07-09","arxiv_id":"2107.04197","n_code_links":1,"syntology":null},{"paper":null,"title":"On the Convergence of Step Decay Step-Size for Stochastic Optimization","date":"2021-02-18","arxiv_id":"2102.09393","n_code_links":0,"syntology":null},{"paper":"/paper/hit-detector-hierarchical-trinity","title":"Hit-Detector: Hierarchical Trinity Architecture Search for Object Detection","date":"2020-03-26","arxiv_id":"2003.11818","n_code_links":1,"syntology":null},{"paper":"/paper/harmonic-convolutional-networks-based-on","title":"Harmonic Convolutional Networks based on Discrete Cosine Transform","date":"2020-01-18","arxiv_id":"2001.06570","n_code_links":1,"syntology":{"ran":0,"of":10,"unverified":10,"pointer_only":0}},{"paper":"/paper/matrixnets-a-new-scale-and-aspect-ratio-aware","title":"MatrixNets: A New Scale and Aspect Ratio Aware Architecture for Object Detection","date":"2020-01-09","arxiv_id":"2001.03194","n_code_links":1,"syntology":null},{"paper":"/paper/bridging-the-gap-between-anchor-based-and","title":"Bridging the Gap Between Anchor-based and Anchor-free Detection via Adaptive Training Sample Selection","date":"2019-12-05","arxiv_id":"1912.02424","n_code_links":13,"syntology":{"ran":0,"of":4,"unverified":4,"pointer_only":0}},{"paper":"/paper/cspnet-a-new-backbone-that-can-enhance","title":"CSPNet: A New Backbone that can Enhance Learning Capability of CNN","date":"2019-11-27","arxiv_id":"1911.11929","n_code_links":123,"syntology":null},{"paper":"/paper/self-training-with-noisy-student-improves","title":"Self-training with Noisy Student improves ImageNet classification","date":"2019-11-11","arxiv_id":"1911.04252","n_code_links":13,"syntology":{"ran":5,"of":24,"unverified":19,"pointer_only":0}},{"paper":"/paper/eca-net-efficient-channel-attention-for-deep","title":"ECA-Net: Efficient Channel Attention for Deep Convolutional Neural Networks","date":"2019-10-08","arxiv_id":"1910.03151","n_code_links":13,"syntology":{"ran":1,"of":8,"unverified":7,"pointer_only":0}},{"paper":"/paper/freeanchor-learning-to-match-anchors-for","title":"FreeAnchor: Learning to Match Anchors for Visual Object Detection","date":"2019-09-05","arxiv_id":"1909.02466","n_code_links":4,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":0}},{"paper":"/paper/instaboost-boosting-instance-segmentation-via","title":"InstaBoost: Boosting Instance Segmentation via Probability Map Guided Copy-Pasting","date":"2019-08-21","arxiv_id":"1908.07801","n_code_links":3,"syntology":null},{"paper":"/paper/scarletnas-bridging-the-gap-between","title":"SCARLET-NAS: Bridging the Gap between Stability and Scalability in Weight-sharing Neural Architecture Search","date":"2019-08-16","arxiv_id":"1908.06022","n_code_links":1,"syntology":null},{"paper":"/paper/compact-global-descriptor-for-neural-networks","title":"Compact Global Descriptor for Neural Networks","date":"2019-07-23","arxiv_id":"1907.09665","n_code_links":1,"syntology":null},{"paper":"/paper/stochastic-algorithms-with-geometric-step","title":"Stochastic algorithms with geometric step decay converge linearly on sharp functions","date":"2019-07-22","arxiv_id":"1907.09547","n_code_links":1,"syntology":null},{"paper":"/paper/learning-data-augmentation-strategies-for","title":"Learning Data Augmentation Strategies for Object Detection","date":"2019-06-26","arxiv_id":"1906.11172","n_code_links":6,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}},{"paper":"/paper/spatial-group-wise-enhance-improving-semantic","title":"Spatial Group-wise Enhance: Improving Semantic Feature Learning in Convolutional Networks","date":"2019-05-23","arxiv_id":"1905.09646","n_code_links":3,"syntology":{"ran":2,"of":4,"unverified":2,"pointer_only":4}},{"paper":"/paper/cutmix-regularization-strategy-to-train","title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","date":"2019-05-13","arxiv_id":"1905.04899","n_code_links":30,"syntology":{"ran":17,"of":24,"unverified":7,"pointer_only":5}},{"paper":"/paper/searching-for-mobilenetv3","title":"Searching for MobileNetV3","date":"2019-05-06","arxiv_id":"1905.02244","n_code_links":67,"syntology":{"ran":58,"of":105,"unverified":47,"pointer_only":46}},{"paper":"/paper/the-step-decay-schedule-a-near-optimal","title":"The Step Decay Schedule: A Near Optimal, Geometrically Decaying Learning Rate Procedure For Least Squares","date":"2019-04-29","arxiv_id":"1904.12838","n_code_links":1,"syntology":{"ran":1,"of":2,"unverified":1,"pointer_only":0}},{"paper":"/paper/gcnet-non-local-networks-meet-squeeze","title":"GCNet: Non-local Networks Meet Squeeze-Excitation Networks and Beyond","date":"2019-04-25","arxiv_id":"1904.11492","n_code_links":9,"syntology":null},{"paper":"/paper/an-energy-and-gpu-computation-efficient","title":"An Energy and GPU-Computation Efficient Backbone Network for Real-Time Object Detection","date":"2019-04-22","arxiv_id":"1904.09730","n_code_links":12,"syntology":null},{"paper":"/paper/190409460","title":"Data-Driven Neuron Allocation for Scale Aggregation Networks","date":"2019-04-20","arxiv_id":"1904.09460","n_code_links":1,"syntology":null},{"paper":"/paper/centernet-object-detection-with-keypoint","title":"CenterNet: Keypoint Triplets for Object Detection","date":"2019-04-17","arxiv_id":"1904.08189","n_code_links":20,"syntology":{"ran":2,"of":11,"unverified":9,"pointer_only":2}},{"paper":"/paper/nas-fpn-learning-scalable-feature-pyramid","title":"NAS-FPN: Learning Scalable Feature Pyramid Architecture for Object Detection","date":"2019-04-16","arxiv_id":"1904.07392","n_code_links":8,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/object-detection","name":"Object Detection","papers":39},{"task":"/task/image-classification","name":"Image Classification","papers":38},{"task":"/task/object-detection-1","name":"object-detection","papers":23},{"task":"/task/classification","name":"General Classification","papers":17},{"task":"/task/object","name":"Object","papers":16},{"task":"/task/image-classification","name":"image-classification","papers":15},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":11},{"task":"/task/classification-1","name":"Classification","papers":8},{"task":"/task/object-recognition","name":"Object Recognition","papers":6},{"task":"/task/real-time-object-detection","name":"Real-Time Object Detection","papers":6},{"task":"/task/instance-segmentation","name":"Instance Segmentation","papers":5},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":4},{"task":"/task/architecture-search","name":"Neural Architecture Search","papers":4},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":3},{"task":null,"name":"GPU","papers":3},{"task":"/task/medical-image-classification","name":"Medical Image Classification","papers":3},{"task":"/task/person-re-identification","name":"Person Re-Identification","papers":3},{"task":"/task/segmentation","name":"Segmentation","papers":3},{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":3},{"task":"/task/decoder","name":"Decoder","papers":2}],"tasks_shown":20,"n_tasks":84,"usage_by_year":[{"year":"2012","papers":1},{"year":"2013","papers":2},{"year":"2014","papers":3},{"year":"2015","papers":3},{"year":"2016","papers":9},{"year":"2017","papers":6},{"year":"2018","papers":11},{"year":"2019","papers":27},{"year":"2020","papers":3},{"year":"2021","papers":3},{"year":"2022","papers":1},{"year":"2023","papers":2},{"year":"2024","papers":1},{"year":"2025","papers":1}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/step-decay"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}