{"url":"/method/shakedrop","slug":"shakedrop","name":"ShakeDrop","full_name":"ShakeDrop","full_name_withheld":false,"description_markdown":"**ShakeDrop regularization** extends [Shake-Shake regularization](https://paperswithcode.com/method/shake-shake-regularization) and can be applied not only to [ResNeXt](https://paperswithcode.com/method/resnext) but also [ResNet](https://paperswithcode.com/method/resnet), [WideResNet](https://paperswithcode.com/method/wideresnet), and [PyramidNet](https://paperswithcode.com/method/pyramidnet). The proposed ShakeDrop is given as\r\n\r\n$$G\\left(x\\right) = x + \\left(b\\_{l} + \\alpha − b\\_{l}\\alpha\\right)F\\left(x\\right), \\text{ in train-fwd} $$\r\n$$G\\left(x\\right) = x + \\left(b\\_{l} + \\beta − b\\_{l}\\beta\\right)F\\left(x\\right), \\text{ in train-bwd} $$\r\n$$G\\left(x\\right) = x + E\\left[b\\_{l} + \\alpha − b\\_{l}\\alpha\\right]F\\left(x\\right), \\text{ in test} $$\r\n\r\nwhere $b\\_{l}$ is a Bernoulli random variable with probability $P\\left(b\\_{l} = 1\\right) = E\\left[b\\_{l}\r\n\\right] = p\\_{l}$ given by the linear decay rule in each layer, and $\\alpha$ and $\\beta$ are independent uniform random variables in each element. \r\n\r\nThe most effective ranges of $\\alpha$ and $\\beta$ were experimentally found to be different from those of Shake-Shake, and are $\\alpha$ = 0, $\\beta \\in \\left[0, 1\\right]$ and $\\alpha \\in \\left[−1, 1\\right]$, $\\beta \\in \\left[0, 1\\right]$.","description_state":"present","introduced_year":null,"introduced_by":{"title":"ShakeDrop Regularization for Deep Residual Learning","paper":"/paper/shakedrop-regularization-for-deep-residual","first_author":"Yoshihiro Yamada","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/shakedrop-regularization-for-deep-residual"},"source":{"url":"https://arxiv.org/abs/1802.02375v3","title":"ShakeDrop Regularization for Deep Residual Learning","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/owruby/shake-drop_pytorch/blob/4ef188475101dfc6f73191388e320969823f9e7d/models/shakedrop.py#L9","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Regularization","url":"/methods/category/regularization","pwc_aliases":[]}],"n_papers_tagged":3,"archive_num_papers":3,"papers_newest_first":[{"paper":"/paper/circumventing-outliers-of-autoaugment-with","title":"Circumventing Outliers of AutoAugment with Knowledge Distillation","date":"2020-03-25","arxiv_id":"2003.11342","n_code_links":1,"syntology":null},{"paper":"/paper/randaugment-practical-data-augmentation-with","title":"RandAugment: Practical automated data augmentation with a reduced search space","date":"2019-09-30","arxiv_id":"1909.13719","n_code_links":19,"syntology":{"ran":58,"of":65,"unverified":7,"pointer_only":17}},{"paper":"/paper/shakedrop-regularization-for-deep-residual","title":"ShakeDrop Regularization for Deep Residual Learning","date":"2018-02-07","arxiv_id":"1802.02375","n_code_links":5,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}}],"papers_shown":3,"tasks":[{"task":"/task/data-augmentation","name":"Data Augmentation","papers":2},{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/image-classification","name":"image-classification","papers":2},{"task":"/task/domain-generalization","name":"Domain Generalization","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/knowledge-distillation","name":"Knowledge Distillation","papers":1},{"task":"/task/object-detection","name":"Object Detection","papers":1},{"task":"/task/object-detection-1","name":"object-detection","papers":1}],"tasks_shown":8,"n_tasks":8,"usage_by_year":[{"year":"2018","papers":1},{"year":"2019","papers":1},{"year":"2020","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/shakedrop"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}