{"url":"/method/rmsnorm","slug":"rmsnorm","name":"RMSNorm","full_name":"Root Mean Square Layer Normalization","full_name_withheld":false,"description_markdown":"RMSNorm regularizes the summed inputs to a neuron in one layer according to root mean square (RMS), giving the model re-scaling invariance property and implicit learning rate adaptation ability. RMSNorm is computationally simpler and thus more efficient than LayerNorm.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/1910.07467v1","title":"Root Mean Square Layer Normalization","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Normalization","url":"/methods/category/normalization","pwc_aliases":[]}],"n_papers_tagged":14,"archive_num_papers":null,"papers_newest_first":[{"paper":null,"title":"Pangu Light: Weight Re-Initialization for Pruning and Accelerating LLMs","date":"2025-05-26","arxiv_id":"2505.20155","n_code_links":0,"syntology":null},{"paper":null,"title":"TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference","date":"2025-05-16","arxiv_id":"2505.11329","n_code_links":0,"syntology":null},{"paper":null,"title":"Blockbuster, Part 1: Block-level AI Operator Fusion","date":"2025-04-29","arxiv_id":"2505.07829","n_code_links":0,"syntology":null},{"paper":null,"title":"Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm","date":"2024-09-19","arxiv_id":"2409.12951","n_code_links":0,"syntology":null},{"paper":"/paper/you-can-remove-gpt2-s-layernorm-by-fine","title":"You can remove GPT2's LayerNorm by fine-tuning","date":"2024-09-06","arxiv_id":"2409.13710","n_code_links":1,"syntology":null},{"paper":"/paper/beat-this-accurate-beat-tracking-without-dbn","title":"Beat this! Accurate beat tracking without DBN postprocessing","date":"2024-07-31","arxiv_id":"2407.21658","n_code_links":1,"syntology":null},{"paper":"/paper/flash-normalization-fast-rmsnorm-for-llms","title":"Flash normalization: fast RMSNorm for LLMs","date":"2024-07-12","arxiv_id":"2407.09577","n_code_links":1,"syntology":null},{"paper":"/paper/yourmt3-multi-instrument-music-transcription","title":"YourMT3+: Multi-instrument Music Transcription with Enhanced Transformer Architectures and Cross-dataset Stem Augmentation","date":"2024-07-05","arxiv_id":"2407.04822","n_code_links":1,"syntology":null},{"paper":null,"title":"I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models","date":"2024-05-28","arxiv_id":"2405.17849","n_code_links":0,"syntology":null},{"paper":"/paper/lumina-t2x-transforming-text-into-any","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","date":"2024-05-09","arxiv_id":"2405.05945","n_code_links":2,"syntology":null},{"paper":"/paper/griffin-mixing-gated-linear-recurrences-with","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","date":"2024-02-29","arxiv_id":"2402.19427","n_code_links":4,"syntology":{"ran":0,"of":10,"unverified":10,"pointer_only":0}},{"paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","arxiv_id":"2307.09288","n_code_links":19,"syntology":{"ran":31,"of":52,"unverified":21,"pointer_only":16}},{"paper":"/paper/pre-rmsnorm-and-pre-crmsnorm-transformers","title":"Pre-RMSNorm and Pre-CRMSNorm Transformers: Equivalent and Efficient Pre-LN Transformers","date":"2023-05-24","arxiv_id":"2305.14858","n_code_links":1,"syntology":{"ran":0,"of":2,"unverified":2,"pointer_only":0}},{"paper":"/paper/root-mean-square-layer-normalization","title":"Root Mean Square Layer Normalization","date":"2019-10-16","arxiv_id":"1910.07467","n_code_links":8,"syntology":{"ran":1,"of":2,"unverified":1,"pointer_only":0}}],"papers_shown":14,"tasks":[{"task":"/task/arithmetic-reasoning","name":"Arithmetic Reasoning","papers":1},{"task":"/task/beat-tracking","name":"Beat Tracking","papers":1},{"task":"/task/code-generation","name":"Code Generation","papers":1},{"task":"/task/downbeat-tracking","name":"Downbeat Tracking","papers":1},{"task":"/task/drum-transcription","name":"Drum Transcription","papers":1},{"task":"/task/drum-transcription-in-music-dtm","name":"Drum Transcription in Music (DTM)","papers":1},{"task":"/task/hellaswag","name":"HellaSwag","papers":1},{"task":"/task/language-modelling","name":"Language Modelling","papers":1},{"task":"/task/mamba","name":"Mamba","papers":1},{"task":"/task/math-word-problem-solving","name":"Math Word Problem Solving","papers":1},{"task":"/task/mixture-of-experts","name":"Mixture-of-Experts","papers":1},{"task":"/task/model-compression","name":"Model Compression","papers":1},{"task":"/task/multi-task-learning","name":"Multi-Task Learning","papers":1},{"task":"/task/multi-instrument-music-transcription","name":"Multi-instrument Music Transcription","papers":1},{"task":"/task/multi-task-language-understanding","name":"Multi-task Language Understanding","papers":1},{"task":"/task/multiple-choice-qa","name":"Multiple Choice Question Answering (MCQA)","papers":1},{"task":"/task/music-transcription","name":"Music Transcription","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/question-answering","name":"Question Answering","papers":1},{"task":"/task/sentence-completion","name":"Sentence Completion","papers":1}],"tasks_shown":20,"n_tasks":20,"usage_by_year":[{"year":"2019","papers":1},{"year":"2023","papers":2},{"year":"2024","papers":8},{"year":"2025","papers":3}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/rmsnorm"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}