{"url":"/method/sparsemax","slug":"sparsemax","name":"Sparsemax","full_name":"Sparsemax","full_name_withheld":false,"description_markdown":"**Sparsemax** is a type of activation/output function similar to the traditional [softmax](https://paperswithcode.com/method/softmax), but able to output sparse probabilities. \r\n\r\n$$ \\text{sparsemax}\\left(z\\right) = \\arg\\_{p∈\\Delta^{K−1}}\\min||\\mathbf{p} - \\mathbf{z}||^{2} $$","description_state":"present","introduced_year":null,"introduced_by":{"title":"From Softmax to Sparsemax: A Sparse Model of Attention and Multi-Label Classification","paper":"/paper/from-softmax-to-sparsemax-a-sparse-model-of","first_author":"André F. T. Martins","n_authors":2,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/from-softmax-to-sparsemax-a-sparse-model-of"},"source":{"url":"http://arxiv.org/abs/1602.02068v2","title":"From Softmax to Sparsemax: A Sparse Model of Attention and Multi-Label Classification","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/vene/sparse-structured-attention/blob/e89a2162bdde3a86b7dfdba22e292ea3bd3880d3/pytorch/torchsparseattn/sparsemax.py#L47","code_snippet_url_on_a_code_host":true,"categories":[{"area":"General","area_id":"general","collection":"Output Functions","url":"/methods/category/output-functions","pwc_aliases":[]}],"n_papers_tagged":27,"archive_num_papers":27,"papers_newest_first":[{"paper":"/paper/zo-darts-an-efficient-and-size-variable","title":"ZO-DARTS++: An Efficient and Size-Variable Zeroth-Order Neural Architecture Search Algorithm","date":"2025-03-08","arxiv_id":"2503.06092","n_code_links":1,"syntology":null},{"paper":"/paper/sparse-activations-as-conformal-predictors","title":"Sparse Activations as Conformal Predictors","date":"2025-02-20","arxiv_id":"2502.14773","n_code_links":1,"syntology":null},{"paper":null,"title":"Joint Learning of Energy-based Models and their Partition Function","date":"2025-01-30","arxiv_id":"2501.18528","n_code_links":0,"syntology":null},{"paper":null,"title":"Learning with Fitzpatrick Losses","date":"2024-05-23","arxiv_id":"2405.14574","n_code_links":0,"syntology":null},{"paper":null,"title":"MixLight: Borrowing the Best of both Spherical Harmonics and Gaussian Models","date":"2024-04-19","arxiv_id":"2404.12768","n_code_links":0,"syntology":null},{"paper":null,"title":"Subject-specific Deep Neural Networks for Count Data with High-cardinality Categorical Features","date":"2023-10-18","arxiv_id":"2310.11654","n_code_links":0,"syntology":null},{"paper":"/paper/focus-effective-embedding-initialization-for","title":"FOCUS: Effective Embedding Initialization for Monolingual Specialization of Multilingual Models","date":"2023-05-23","arxiv_id":"2305.14481","n_code_links":2,"syntology":null},{"paper":null,"title":"$q$-Munchausen Reinforcement Learning","date":"2022-05-16","arxiv_id":"2205.07467","n_code_links":0,"syntology":null},{"paper":null,"title":"Are Transformers More Robust? Towards Exact Robustness Verification for Transformers","date":"2022-02-08","arxiv_id":"2202.03932","n_code_links":0,"syntology":null},{"paper":"/paper/sampling-network-guided-cross-entropy-method","title":"Sampling Network Guided Cross-Entropy Method for Unsupervised Point Cloud Registration","date":"2021-09-14","arxiv_id":"2109.06619","n_code_links":1,"syntology":{"ran":0,"of":5,"unverified":5,"pointer_only":0}},{"paper":"/paper/sparse-communication-via-mixed-distributions","title":"Sparse Communication via Mixed Distributions","date":"2021-08-05","arxiv_id":"2108.02658","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":"/paper/sparse-continuous-distributions-and-fenchel","title":"Sparse Continuous Distributions and Fenchel-Young Losses","date":"2021-08-04","arxiv_id":"2108.01988","n_code_links":1,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":null,"title":"Reconciling the Discrete-Continuous Divide: Towards a Mathematical Theory of Sparse Communication","date":"2021-04-01","arxiv_id":"2104.00755","n_code_links":0,"syntology":null},{"paper":null,"title":"Scaling sparsemax based channel selection for speech recognition with ad-hoc microphone arrays","date":"2021-03-29","arxiv_id":"2103.15305","n_code_links":0,"syntology":null},{"paper":null,"title":"A Comparative Study of Deep Learning Loss Functions for Multi-Label Remote Sensing Image Classification","date":"2020-09-29","arxiv_id":"2009.13935","n_code_links":0,"syntology":null},{"paper":"/paper/efficient-marginalization-of-discrete-and","title":"Efficient Marginalization of Discrete and Structured Latent Variables via Sparsity","date":"2020-07-03","arxiv_id":"2007.01919","n_code_links":1,"syntology":{"ran":0,"of":9,"unverified":9,"pointer_only":0}},{"paper":null,"title":"Exploring Neural Architectures And Techniques For Typologically Diverse Morphological Inflection","date":"2020-07-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/sparse-and-continuous-attention-mechanisms","title":"Sparse and Continuous Attention Mechanisms","date":"2020-06-12","arxiv_id":"2006.07214","n_code_links":2,"syntology":{"ran":12,"of":15,"unverified":3,"pointer_only":2}},{"paper":"/paper/pruning-and-sparsemax-methods-for","title":"Pruning and Sparsemax Methods for Hierarchical Attention Networks","date":"2020-04-08","arxiv_id":"2004.04343","n_code_links":2,"syntology":null},{"paper":"/paper/sparse-text-generation","title":"Sparse Text Generation","date":"2020-04-06","arxiv_id":"2004.02644","n_code_links":1,"syntology":null},{"paper":"/paper/gsanet-semantic-segmentation-with-global-and","title":"GSANet: Semantic Segmentation with Global and Selective Attention","date":"2020-02-14","arxiv_id":"2003.00830","n_code_links":0,"syntology":null},{"paper":"/paper/explicit-sparse-transformer-concentrated","title":"Explicit Sparse Transformer: Concentrated Attention Through Explicit Selection","date":"2019-12-25","arxiv_id":"1912.11637","n_code_links":2,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}},{"paper":null,"title":"Understanding Multi-Head Attention in Abstractive Summarization","date":"2019-11-10","arxiv_id":"1911.03898","n_code_links":0,"syntology":null},{"paper":"/paper/sparse-sequence-to-sequence-models","title":"Sparse Sequence-to-Sequence Models","date":"2019-05-14","arxiv_id":"1905.05702","n_code_links":1,"syntology":null},{"paper":"/paper/ssn-learning-sparse-switchable-normalization","title":"SSN: Learning Sparse Switchable Normalization via SparsestMax","date":"2019-03-09","arxiv_id":"1903.03793","n_code_links":1,"syntology":null},{"paper":null,"title":"Maximum Causal Tsallis Entropy Imitation Learning","date":"2018-05-22","arxiv_id":"1805.08336","n_code_links":0,"syntology":null},{"paper":"/paper/from-softmax-to-sparsemax-a-sparse-model-of","title":"From Softmax to Sparsemax: A Sparse Model of Attention and Multi-Label Classification","date":"2016-02-05","arxiv_id":"1602.02068","n_code_links":11,"syntology":{"ran":8,"of":8,"unverified":0,"pointer_only":2}}],"papers_shown":27,"tasks":[{"task":"/task/machine-translation","name":"Machine Translation","papers":4},{"task":"/task/translation","name":"Translation","papers":4},{"task":"/task/classification","name":"General Classification","papers":3},{"task":"/task/language-modeling","name":"Language Modeling","papers":3},{"task":"/task/language-modelling","name":"Language Modelling","papers":3},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":"/task/morphological-inflection","name":"Morphological Inflection","papers":2},{"task":"/task/question-answering","name":"Question Answering","papers":2},{"task":"/task/text-classification","name":"Text Classification","papers":2},{"task":"/task/visual-question-answering-1","name":"Visual Question Answering","papers":2},{"task":"/task/visual-question-answering","name":"Visual Question Answering (VQA)","papers":2},{"task":"/task/text-classification-1","name":"text-classification","papers":2},{"task":"/task/abstractive-text-summarization","name":"Abstractive Text Summarization","papers":1},{"task":"/task/audio-classification","name":"Audio Classification","papers":1},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":1},{"task":"/task/conformal-prediction","name":"Conformal Prediction","papers":1},{"task":"/task/dialogue-generation","name":"Dialogue Generation","papers":1},{"task":"/task/diversity","name":"Diversity","papers":1},{"task":"/task/document-classification","name":"Document Classification","papers":1},{"task":"/task/hallucination","name":"Hallucination","papers":1}],"tasks_shown":20,"n_tasks":51,"usage_by_year":[{"year":"2016","papers":1},{"year":"2018","papers":1},{"year":"2019","papers":4},{"year":"2020","papers":7},{"year":"2021","papers":5},{"year":"2022","papers":2},{"year":"2023","papers":2},{"year":"2024","papers":2},{"year":"2025","papers":3}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/sparsemax"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}