{"url":"/method/softmax","slug":"softmax","name":"Softmax","full_name":"Softmax","full_name_withheld":false,"description_markdown":"The **Softmax** output function transforms a previous layer's output into a vector of probabilities. It is commonly used for multiclass classification.  Given an input vector $x$ and a weighting vector $w$ we have:\r\n\r\n$$ P(y=j \\mid{x}) = \\frac{e^{x^{T}w_{j}}}{\\sum^{K}_{k=1}e^{x^{T}wk}} $$","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Output Functions","url":"/methods/category/output-functions","pwc_aliases":[]}],"n_papers_tagged":37443,"archive_num_papers":37448,"papers_newest_first":[{"paper":null,"title":"DASViT: Differentiable Architecture Search for Vision Transformer","date":"2025-07-17","arxiv_id":"2507.13079","n_code_links":0,"syntology":null},{"paper":"/paper/making-language-model-a-hierarchical","title":"Making Language Model a Hierarchical Classifier and Generator","date":"2025-07-17","arxiv_id":"2507.12930","n_code_links":1,"syntology":null},{"paper":"/paper/best-practices-for-large-scale-pixel-wise","title":"Best Practices for Large-Scale, Pixel-Wise Crop Mapping and Transfer Learning Workflows","date":"2025-07-16","arxiv_id":"2507.12590","n_code_links":1,"syntology":null},{"paper":"/paper/dvfl-net-a-lightweight-distilled-video-focal","title":"DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition","date":"2025-07-16","arxiv_id":"2507.12426","n_code_links":1,"syntology":null},{"paper":null,"title":"Biological Processing Units: Leveraging an Insect Connectome to Pioneer Biofidelic Neural Architectures","date":"2025-07-15","arxiv_id":"2507.10951","n_code_links":0,"syntology":null},{"paper":null,"title":"Generative Click-through Rate Prediction with Applications to Search Advertising","date":"2025-07-15","arxiv_id":"2507.11246","n_code_links":0,"syntology":null},{"paper":"/paper/hashed-watermark-as-a-filter-defeating","title":"Hashed Watermark as a Filter: Defeating Forging and Overwriting Attacks in Weight-based Neural Network Watermarking","date":"2025-07-15","arxiv_id":"2507.11137","n_code_links":1,"syntology":null},{"paper":"/paper/kv-latent-dimensional-level-kv-cache","title":"KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding","date":"2025-07-15","arxiv_id":"2507.11273","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}},{"paper":"/paper/langevin-flows-for-modeling-neural-latent","title":"Langevin Flows for Modeling Neural Latent Dynamics","date":"2025-07-15","arxiv_id":"2507.11531","n_code_links":1,"syntology":null},{"paper":"/paper/systolicattention-fusing-flashattention","title":"SystolicAttention: Fusing FlashAttention within a Single Systolic Array","date":"2025-07-15","arxiv_id":"2507.11331","n_code_links":1,"syntology":null},{"paper":null,"title":"Feature Distillation is the Better Choice for Model-Heterogeneous Federated Learning","date":"2025-07-14","arxiv_id":"2507.10348","n_code_links":0,"syntology":null},{"paper":"/paper/zclassifier-temperature-tuning-and-manifold","title":"ZClassifier: Temperature Tuning and Manifold Approximation via KL Divergence on Logit Space","date":"2025-07-14","arxiv_id":"2507.10638","n_code_links":1,"syntology":null},{"paper":null,"title":"Token Compression Meets Compact Vision Transformers: A Survey and Comparative Evaluation for Edge AI","date":"2025-07-13","arxiv_id":"2507.09702","n_code_links":0,"syntology":null},{"paper":null,"title":"Learning from Synthetic Labs: Language Models as Auction Participants","date":"2025-07-12","arxiv_id":"2507.09083","n_code_links":0,"syntology":null},{"paper":null,"title":"Comparative Analysis of Vision Transformers and Traditional Deep Learning Approaches for Automated Pneumonia Detection in Chest X-Rays","date":"2025-07-11","arxiv_id":"2507.10589","n_code_links":0,"syntology":null},{"paper":null,"title":"Lizard: An Efficient Linearization Framework for Large Language Models","date":"2025-07-11","arxiv_id":"2507.09025","n_code_links":0,"syntology":null},{"paper":null,"title":"A Wireless Foundation Model for Multi-Task Prediction","date":"2025-07-08","arxiv_id":"2507.05938","n_code_links":0,"syntology":null},{"paper":"/paper/agent-kb-leveraging-cross-domain-experience","title":"Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving","date":"2025-07-08","arxiv_id":"2507.06229","n_code_links":1,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":0}},{"paper":null,"title":"Chat-Ghosting: A Comparative Study of Methods for Auto-Completion in Dialog Systems","date":"2025-07-08","arxiv_id":"2507.05940","n_code_links":0,"syntology":null},{"paper":null,"title":"Detecting and Mitigating Reward Hacking in Reinforcement Learning Systems: A Comprehensive Empirical Study","date":"2025-07-08","arxiv_id":"2507.05619","n_code_links":0,"syntology":null},{"paper":"/paper/from-id-based-to-id-free-rethinking-id","title":"From ID-based to ID-free: Rethinking ID Effectiveness in Multimodal Collaborative Filtering Recommendation","date":"2025-07-08","arxiv_id":"2507.05715","n_code_links":1,"syntology":null},{"paper":null,"title":"Geo-Registration of Terrestrial LiDAR Point Clouds with Satellite Images without GNSS","date":"2025-07-08","arxiv_id":"2507.05999","n_code_links":0,"syntology":null},{"paper":"/paper/growing-transformers-modular-composition-and","title":"Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate","date":"2025-07-08","arxiv_id":"2507.07129","n_code_links":1,"syntology":null},{"paper":null,"title":"SARA: Selective and Adaptive Retrieval-augmented Generation with Context Compression","date":"2025-07-08","arxiv_id":"2507.05633","n_code_links":0,"syntology":null},{"paper":"/paper/tile-based-vit-inference-with-visual-cluster","title":"Tile-Based ViT Inference with Visual-Cluster Priors for Zero-Shot Multi-Species Plant Identification","date":"2025-07-08","arxiv_id":"2507.06093","n_code_links":1,"syntology":null},{"paper":null,"title":"AI Generated Text Detection Using Instruction Fine-tuned Large Language and Transformer-Based Models","date":"2025-07-07","arxiv_id":"2507.05157","n_code_links":0,"syntology":null},{"paper":"/paper/emergent-semantics-beyond-token-embeddings","title":"Emergent Semantics Beyond Token Embeddings: Transformer LMs with Frozen Visual Unicode Representations","date":"2025-07-07","arxiv_id":"2507.04886","n_code_links":1,"syntology":null},{"paper":null,"title":"Estimating Interventional Distributions with Uncertain Causal Graphs through Meta-Learning","date":"2025-07-07","arxiv_id":"2507.05526","n_code_links":0,"syntology":null},{"paper":"/paper/sv-drr-high-fidelity-novel-view-x-ray","title":"SV-DRR: High-Fidelity Novel View X-Ray Synthesis Using Diffusion Model","date":"2025-07-07","arxiv_id":"2507.05148","n_code_links":1,"syntology":null},{"paper":null,"title":"Behaviour Space Analysis of LLM-driven Meta-heuristic Discovery","date":"2025-07-04","arxiv_id":"2507.03605","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/language-modelling","name":"Language Modelling","papers":3434},{"task":"/task/language-modeling","name":"Language Modeling","papers":2738},{"task":"/task/retrieval","name":"Retrieval","papers":2062},{"task":"/task/decoder","name":"Decoder","papers":1736},{"task":"/task/question-answering","name":"Question Answering","papers":1673},{"task":"/task/object-detection","name":"Object Detection","papers":1632},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1608},{"task":"/task/object-detection-1","name":"object-detection","papers":1505},{"task":"/task/sentence","name":"Sentence","papers":1465},{"task":"/task/rag","name":"RAG","papers":1381},{"task":"/task/image-classification","name":"Image Classification","papers":1323},{"task":"/task/retrieval-augmented-generation","name":"Retrieval-augmented Generation","papers":1208},{"task":"/task/translation","name":"Translation","papers":1173},{"task":"/task/segmentation","name":"Segmentation","papers":1134},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1102},{"task":"/task/image-classification","name":"image-classification","papers":1083},{"task":"/task/machine-translation","name":"Machine Translation","papers":1029},{"task":"/task/classification-1","name":"Classification","papers":1028},{"task":"/task/object","name":"Object","papers":1003},{"task":"/task/large-language-model","name":"Large Language Model","papers":998}],"tasks_shown":20,"n_tasks":2924,"usage_by_year":[{"year":"2009","papers":1},{"year":"2011","papers":1},{"year":"2012","papers":2},{"year":"2013","papers":5},{"year":"2014","papers":11},{"year":"2015","papers":68},{"year":"2016","papers":134},{"year":"2017","papers":301},{"year":"2018","papers":653},{"year":"2019","papers":1937},{"year":"2020","papers":3042},{"year":"2021","papers":3987},{"year":"2022","papers":4025},{"year":"2023","papers":5978},{"year":"2024","papers":11110},{"year":"2025","papers":6188}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/softmax"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}