{"url":"/method/swiglu","slug":"swiglu","name":"SwiGLU","full_name":"SwiGLU","full_name_withheld":false,"description_markdown":"**SwiGLU** is an activation function which is a variant of [GLU](https://paperswithcode.com/method/glu). The definition is as follows:\r\n\r\n$$ \\text{SwiGLU}\\left(x, W, V, b, c, \\beta\\right) = \\text{Swish}\\_{\\beta}\\left(xW + b\\right) \\otimes \\left(xV + c\\right) $$","description_state":"present","introduced_year":null,"introduced_by":{"title":"GLU Variants Improve Transformer","paper":"/paper/glu-variants-improve-transformer","first_author":"Noam Shazeer","n_authors":1,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/glu-variants-improve-transformer"},"source":{"url":"https://arxiv.org/abs/2002.05202v1","title":"GLU Variants Improve Transformer","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Activation Functions","url":"/methods/category/activation-functions","pwc_aliases":[]}],"n_papers_tagged":13,"archive_num_papers":13,"papers_newest_first":[{"paper":null,"title":"TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference","date":"2025-04-04","arxiv_id":"2504.03154","n_code_links":0,"syntology":null},{"paper":"/paper/diffformer-a-differential-spatial-spectral","title":"DiffFormer: a Differential Spatial-Spectral Transformer for Hyperspectral Image Classification","date":"2024-12-23","arxiv_id":"2412.17350","n_code_links":1,"syntology":null},{"paper":null,"title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","date":"2024-12-02","arxiv_id":"2412.01380","n_code_links":0,"syntology":null},{"paper":"/paper/deriving-activation-functions-via-integration","title":"Deriving Activation Functions Using Integration","date":"2024-11-20","arxiv_id":"2411.13010","n_code_links":1,"syntology":null},{"paper":null,"title":"Scaling FP8 training to trillion-token LLMs","date":"2024-09-19","arxiv_id":"2409.12517","n_code_links":0,"syntology":null},{"paper":null,"title":"How Lightweight Can A Vision Transformer Be","date":"2024-07-25","arxiv_id":"2407.17783","n_code_links":0,"syntology":null},{"paper":"/paper/turbo-sparse-achieving-llm-sota-performance","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","date":"2024-06-10","arxiv_id":"2406.05955","n_code_links":1,"syntology":null},{"paper":null,"title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","date":"2024-02-06","arxiv_id":"2402.03804","n_code_links":0,"syntology":null},{"paper":"/paper/btlm-3b-8k-7b-parameter-performance-in-a-3b","title":"BTLM-3B-8K: 7B Parameter Performance in a 3B Parameter Model","date":"2023-09-20","arxiv_id":"2309.11568","n_code_links":1,"syntology":{"ran":6,"of":8,"unverified":2,"pointer_only":0}},{"paper":"/paper/slimpajama-dc-understanding-data-combinations","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","date":"2023-09-19","arxiv_id":"2309.10818","n_code_links":1,"syntology":null},{"paper":"/paper/llama-2-open-foundation-and-fine-tuned-chat","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","date":"2023-07-18","arxiv_id":"2307.09288","n_code_links":19,"syntology":{"ran":31,"of":52,"unverified":21,"pointer_only":16}},{"paper":"/paper/palm-scaling-language-modeling-with-pathways-1","title":"PaLM: Scaling Language Modeling with Pathways","date":"2022-04-05","arxiv_id":"2204.02311","n_code_links":7,"syntology":{"ran":30,"of":37,"unverified":7,"pointer_only":0}},{"paper":"/paper/glu-variants-improve-transformer","title":"GLU Variants Improve Transformer","date":"2020-02-12","arxiv_id":"2002.05202","n_code_links":27,"syntology":{"ran":9,"of":9,"unverified":0,"pointer_only":7}}],"papers_shown":13,"tasks":[{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/language-modelling","name":"Language Modelling","papers":3},{"task":"/task/code-generation","name":"Code Generation","papers":2},{"task":"/task/large-language-model","name":"Large Language Model","papers":2},{"task":"/task/mixture-of-experts","name":"Mixture-of-Experts","papers":2},{"task":"/task/multi-task-language-understanding","name":"Multi-task Language Understanding","papers":2},{"task":"/task/multiple-choice-qa","name":"Multiple Choice Question Answering (MCQA)","papers":2},{"task":"/task/question-answering","name":"Question Answering","papers":2},{"task":"/task/sentence-completion","name":"Sentence Completion","papers":2},{"task":null,"name":"8k","papers":1},{"task":"/task/arithmetic-reasoning","name":"Arithmetic Reasoning","papers":1},{"task":"/task/auto-debugging","name":"Auto Debugging","papers":1},{"task":"/task/common-sense-reasoning","name":"Common Sense Reasoning","papers":1},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/coreference-resolution","name":"Coreference Resolution","papers":1},{"task":"/task/cross-lingual-question-answering","name":"Cross-Lingual Question Answering","papers":1},{"task":"/task/few-shot-learning","name":"Few-Shot Learning","papers":1},{"task":"/task/hindu-knowledge","name":"Hindu Knowledge","papers":1},{"task":"/task/hyperspectral-image-classification","name":"Hyperspectral Image Classification","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1}],"tasks_shown":20,"n_tasks":35,"usage_by_year":[{"year":"2020","papers":1},{"year":"2022","papers":1},{"year":"2023","papers":3},{"year":"2024","papers":7},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/swiglu"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}