{"url":"/method/onlinenorm","slug":"onlinenorm","name":"Online Normalization","full_name":"Online Normalization","full_name_withheld":false,"description_markdown":"**Online Normalization** is a normalization technique for training deep neural networks. To define Online Normalization. we replace arithmetic averages over the full dataset in with exponentially decaying averages of online samples. The decay factors $\\alpha\\_{f}$ and $\\alpha\\_{b}$ for forward and backward passes respectively are hyperparameters for the technique.\r\n\r\nWe allow incoming samples $x\\_{t}$, such as images, to have multiple scalar components and denote\r\nfeature-wide mean and variance by $\\mu\\left(x\\_{t}\\right)$ and $\\sigma^{2}\\left(x\\_{t}\\right)$. The algorithm also applies to outputs of fully connected layers with only one scalar output per feature. In fact, this case simplifies to $\\mu\\left(x\\_{t}\\right) = x\\_{t}$ and $\\sigma\\left(x\\_{t}\\right) = 0$. Denote scalars $\\mu\\_{t}$ and $\\sigma\\_{t}$ to denote running estimates of mean and variance across\r\nall samples. The subscript $t$ denotes time steps corresponding to processing new incoming samples.\r\n\r\nOnline Normalization uses an ongoing process during the forward pass to estimate activation means\r\nand variances. It implements the standard online computation of mean and variance generalized to processing multi-value samples and exponential averaging of sample statistics. The\r\nresulting estimates directly lead to an affine normalization transform.\r\n\r\n$$ y\\_{t} = \\frac{x\\_{t} - \\mu\\_{t-1}}{\\sigma\\_{t-1}} $$ \r\n\r\n$$ \\mu\\_{t} = \\alpha\\_{f}\\mu\\_{t-1} + \\left(1-\\alpha\\_{f}\\right)\\mu\\left(x\\_{t}\\right) $$\r\n\r\n$$ \\sigma^{2}\\_{t} = \\alpha\\_{f}\\sigma^{2}\\_{t-1} + \\left(1-\\alpha\\_{f}\\right)\\sigma^{2}\\left(x\\_{t}\\right) + \\alpha\\_{f}\\left(1-\\alpha\\_{f}\\right)\\left(\\mu\\left(x\\_{t}\\right) - \\mu\\_{t-1}\\right)^{2} $$","description_state":"present","introduced_year":null,"introduced_by":{"title":"Online Normalization for Training Neural Networks","paper":"/paper/online-normalization-for-training-neural","first_author":"Vitaliy Chiley","n_authors":8,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/online-normalization-for-training-neural"},"source":{"url":"https://arxiv.org/abs/1905.05894v3","title":"Online Normalization for Training Neural Networks","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Normalization","url":"/methods/category/normalization","pwc_aliases":[]}],"n_papers_tagged":3,"archive_num_papers":3,"papers_newest_first":[{"paper":null,"title":"One model to enhance them all: array geometry agnostic multi-channel personalized speech enhancement","date":"2021-10-20","arxiv_id":"2110.10330","n_code_links":0,"syntology":null},{"paper":"/paper/pipelined-backpropagation-at-scale-training","title":"Pipelined Backpropagation at Scale: Training Large Models without Batches","date":"2020-03-25","arxiv_id":"2003.11666","n_code_links":0,"syntology":null},{"paper":"/paper/online-normalization-for-training-neural","title":"Online Normalization for Training Neural Networks","date":"2019-05-15","arxiv_id":"1905.05894","n_code_links":1,"syntology":{"ran":0,"of":16,"unverified":16,"pointer_only":0}}],"papers_shown":3,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":2},{"task":"/task/all","name":"All","papers":1},{"task":"/task/automatic-speech-recognition-2","name":"Automatic Speech Recognition","papers":1},{"task":"/task/automatic-speech-recognition","name":"Automatic Speech Recognition (ASR)","papers":1},{"task":"/task/classification","name":"General Classification","papers":1},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":1},{"task":"/task/language-modeling","name":"Language Modeling","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1},{"task":"/task/speech-enhancement","name":"Speech Enhancement","papers":1},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":1},{"task":"/task/stochastic-optimization","name":"Stochastic Optimization","papers":1},{"task":"/task/image-classification","name":"image-classification","papers":1},{"task":"/task/speech-recognition-1","name":"speech-recognition","papers":1}],"tasks_shown":14,"n_tasks":14,"usage_by_year":[{"year":"2019","papers":1},{"year":"2020","papers":1},{"year":"2021","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/onlinenorm"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}