{"url":"/method/fixup-initialization","slug":"fixup-initialization","name":"Fixup Initialization","full_name":"Fixup Initialization","full_name_withheld":false,"description_markdown":"**FixUp Initialization**, or **Fixed-Update Initialization**, is an initialization method that rescales the standard initialization of [residual branches](https://paperswithcode.com/method/residual-block) by adjusting for the network architecture. Fixup aims to enables training very deep [residual networks](https://paperswithcode.com/method/resnet) stably at a maximal learning rate without [normalization](https://paperswithcode.com/methods/category/normalization).\r\n\r\nThe steps are as follows:\r\n\r\n1. Initialize the classification layer and the last layer of each residual branch to 0.\r\n\r\n2. Initialize every other layer using a standard method, e.g. [Kaiming Initialization](https://paperswithcode.com/method/he-initialization), and scale only the weight layers inside residual branches by $L^{\\frac{1}{2m-2}}$.\r\n\r\n3. Add a scalar multiplier (initialized at 1) in every branch and a scalar bias (initialized at 0) before each [convolution](https://paperswithcode.com/method/convolution), [linear](https://paperswithcode.com/method/linear-layer), and element-wise activation layer.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Fixup Initialization: Residual Learning Without Normalization","paper":"/paper/fixup-initialization-residual-learning","first_author":"Hongyi Zhang","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/fixup-initialization-residual-learning"},"source":{"url":"http://arxiv.org/abs/1901.09321v2","title":"Fixup Initialization: Residual Learning Without Normalization","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Initialization","url":"/methods/category/initialization","pwc_aliases":[]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":null,"title":"Towards Efficient Full 8-bit Integer DNN Online Training on Resource-limited Devices without Batch Normalization","date":"2021-05-27","arxiv_id":"2105.13890","n_code_links":0,"syntology":null},{"paper":"/paper/fixup-initialization-residual-learning","title":"Fixup Initialization: Residual Learning Without Normalization","date":"2019-01-27","arxiv_id":"1901.09321","n_code_links":10,"syntology":{"ran":2,"of":4,"unverified":2,"pointer_only":4}}],"papers_shown":2,"tasks":[{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/machine-translation","name":"Machine Translation","papers":1},{"task":"/task/model-compression","name":"Model Compression","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/translation","name":"Translation","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1}],"tasks_shown":7,"n_tasks":7,"usage_by_year":[{"year":"2019","papers":1},{"year":"2021","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/fixup-initialization"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}