{"url":"/method/l1-regularization","slug":"l1-regularization","name":"L1 Regularization","full_name":"L1 Regularization","full_name_withheld":false,"description_markdown":"**$L_{1}$ Regularization** is a regularization technique applied to the weights of a neural network. We minimize a loss function compromising both the primary loss function and a penalty on the $L\\_{1}$ Norm of the weights:\r\n\r\n$$L\\_{new}\\left(w\\right) = L\\_{original}\\left(w\\right) + \\lambda{||w||}\\_{1}$$\r\n\r\nwhere $\\lambda$ is a value determining the strength of the penalty. In contrast to [weight decay](https://paperswithcode.com/method/weight-decay), $L_{1}$ regularization promotes sparsity; i.e. some parameters have an optimal value of zero.\r\n\r\nImage Source: [Wikipedia](https://en.wikipedia.org/wiki/Regularization_(mathematics)#/media/File:Sparsityl1.png)","description_state":"present","introduced_year":1986,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Parameter Norm Penalties","url":"/methods/category/parameter-norm-penalties","pwc_aliases":[]},{"area":"General","area_id":"general","collection":"Regularization","url":"/methods/category/regularization","pwc_aliases":[]}],"n_papers_tagged":90,"archive_num_papers":90,"papers_newest_first":[{"paper":null,"title":"PRETI: Patient-Aware Retinal Foundation Model via Metadata-Guided Representation Learning","date":"2025-05-18","arxiv_id":"2505.12233","n_code_links":0,"syntology":null},{"paper":null,"title":"SPAT: Sensitivity-based Multihead-attention Pruning on Time Series Forecasting Models","date":"2025-05-13","arxiv_id":"2505.08768","n_code_links":0,"syntology":null},{"paper":null,"title":"Decoding Futures Price Dynamics: A Regularized Sparse Autoencoder for Interpretable Multi-Horizon Forecasting and Factor Discovery","date":"2025-05-11","arxiv_id":"2505.06795","n_code_links":0,"syntology":null},{"paper":"/paper/high-frequency-prior-driven-adaptive-masking","title":"High-Frequency Prior-Driven Adaptive Masking for Accelerating Image Super-Resolution","date":"2025-05-11","arxiv_id":"2505.06975","n_code_links":1,"syntology":null},{"paper":"/paper/bqsched-a-non-intrusive-scheduler-for-batch","title":"BQSched: A Non-intrusive Scheduler for Batch Concurrent Queries via Reinforcement Learning","date":"2025-04-27","arxiv_id":"2504.19142","n_code_links":1,"syntology":null},{"paper":null,"title":"From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation","date":"2025-04-15","arxiv_id":"2504.11368","n_code_links":0,"syntology":null},{"paper":null,"title":"NNN: Next-Generation Neural Networks for Marketing Measurement","date":"2025-04-08","arxiv_id":"2504.06212","n_code_links":0,"syntology":null},{"paper":null,"title":"Remarks on the Polyak-Lojasiewicz inequality and the convergence of gradient systems","date":"2025-03-31","arxiv_id":"2503.23641","n_code_links":0,"syntology":null},{"paper":"/paper/adaptive-rank-allocation-speeding-up-modern","title":"Adaptive Rank Allocation: Speeding Up Modern Transformers with RaNA Adapters","date":"2025-03-23","arxiv_id":"2503.18216","n_code_links":1,"syntology":{"ran":3,"of":4,"unverified":1,"pointer_only":0}},{"paper":null,"title":"Al-Khwarizmi: Discovering Physical Laws with Foundation Models","date":"2025-02-03","arxiv_id":"2502.01702","n_code_links":0,"syntology":null},{"paper":null,"title":"Renewable Energy Prediction: A Comparative Study of Deep Learning Models for Complex Dataset Analysis","date":"2025-01-27","arxiv_id":"2501.15731","n_code_links":0,"syntology":null},{"paper":"/paper/hac-towards-100x-compression-of-3d-gaussian","title":"HAC++: Towards 100X Compression of 3D Gaussian Splatting","date":"2025-01-21","arxiv_id":"2501.12255","n_code_links":2,"syntology":null},{"paper":null,"title":"Kryptonite-N: Machine Learning Strikes Back","date":"2024-12-29","arxiv_id":"2412.20588","n_code_links":0,"syntology":null},{"paper":null,"title":"Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark","date":"2024-11-20","arxiv_id":"2411.13056","n_code_links":0,"syntology":null},{"paper":null,"title":"Carbon price fluctuation prediction using blockchain information A new hybrid machine learning approach","date":"2024-11-05","arxiv_id":"2411.02709","n_code_links":0,"syntology":null},{"paper":"/paper/eh-mam-easy-to-hard-masked-acoustic-modeling","title":"EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning","date":"2024-10-17","arxiv_id":"2410.13179","n_code_links":1,"syntology":{"ran":6,"of":10,"unverified":4,"pointer_only":0}},{"paper":null,"title":"Defending Membership Inference Attacks via Privacy-aware Sparsity Tuning","date":"2024-10-09","arxiv_id":"2410.06814","n_code_links":0,"syntology":null},{"paper":null,"title":"Adaptive Masking Enhances Visual Grounding","date":"2024-10-04","arxiv_id":"2410.03161","n_code_links":0,"syntology":null},{"paper":"/paper/pre-training-on-high-definition-x-ray-images","title":"Pre-training on High Definition X-ray Images: An Experimental Study","date":"2024-04-27","arxiv_id":"2404.17926","n_code_links":1,"syntology":null},{"paper":null,"title":"Salience-Based Adaptive Masking: Revisiting Token Dynamics for Enhanced Pre-training","date":"2024-04-12","arxiv_id":"2404.08327","n_code_links":0,"syntology":null},{"paper":"/paper/sparse-concept-bottleneck-models-gumbel","title":"Sparse Concept Bottleneck Models: Gumbel Tricks in Contrastive Learning","date":"2024-04-04","arxiv_id":"2404.03323","n_code_links":2,"syntology":null},{"paper":null,"title":"Retentive Decision Transformer with Adaptive Masking for Reinforcement Learning based Recommendation Systems","date":"2024-03-26","arxiv_id":"2403.17634","n_code_links":0,"syntology":null},{"paper":"/paper/hac-hash-grid-assisted-context-for-3d","title":"HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression","date":"2024-03-21","arxiv_id":"2403.14530","n_code_links":2,"syntology":null},{"paper":null,"title":"Exploiting Adaptive Contextual Masking for Aspect-Based Sentiment Analysis","date":"2024-02-21","arxiv_id":"2402.13722","n_code_links":0,"syntology":null},{"paper":"/paper/manipulating-sparse-double-descent","title":"Manipulating Sparse Double Descent","date":"2024-01-19","arxiv_id":"2401.10686","n_code_links":1,"syntology":null},{"paper":"/paper/a-novel-hybrid-time-varying-graph-neural","title":"A novel hybrid time-varying graph neural network for traffic flow forecasting","date":"2024-01-17","arxiv_id":"2401.10155","n_code_links":0,"syntology":null},{"paper":null,"title":"On sparse regression, Lp-regularization, and automated model discovery","date":"2023-10-09","arxiv_id":"2310.06872","n_code_links":0,"syntology":null},{"paper":null,"title":"Dynamic ASR Pathways: An Adaptive Masking Approach Towards Efficient Pruning of A Multilingual ASR Model","date":"2023-09-22","arxiv_id":"2309.13018","n_code_links":0,"syntology":null},{"paper":null,"title":"AMLP:Adaptive Masking Lesion Patches for Self-supervised Medical Image Segmentation","date":"2023-09-08","arxiv_id":"2309.04312","n_code_links":0,"syntology":null},{"paper":null,"title":"SDR-GAIN: A High Real-Time Occluded Pedestrian Pose Completion Method for Autonomous Driving","date":"2023-06-06","arxiv_id":"2306.03538","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/representation-learning","name":"Representation Learning","papers":8},{"task":"/task/language-modelling","name":"Language Modelling","papers":7},{"task":"/task/language-modeling","name":"Language Modeling","papers":6},{"task":"/task/feature-selection","name":"feature selection","papers":6},{"task":"/task/l2-regularization","name":"L2 Regularization","papers":4},{"task":"/task/speech-synthesis","name":"Speech Synthesis","papers":4},{"task":"/task/text-to-speech","name":"Text to Speech","papers":4},{"task":"/task/text-to-speech-1","name":"text-to-speech","papers":4},{"task":"/task/machine-learning","name":"BIG-bench Machine Learning","papers":3},{"task":"/task/feature-engineering","name":"Feature Engineering","papers":3},{"task":"/task/image-segmentation","name":"Image Segmentation","papers":3},{"task":"/task/medical-image-segmentation","name":"Medical Image Segmentation","papers":3},{"task":"/task/object-detection","name":"Object Detection","papers":3},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":3},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":3},{"task":"/task/speech-recognition","name":"Speech Recognition","papers":3},{"task":"/task/time-series-1","name":"Time Series","papers":3},{"task":"/task/time-series","name":"Time Series Analysis","papers":3},{"task":"/task/translation","name":"Translation","papers":3},{"task":"/task/object-detection-1","name":"object-detection","papers":3}],"tasks_shown":20,"n_tasks":120,"usage_by_year":[{"year":"2010","papers":1},{"year":"2011","papers":1},{"year":"2015","papers":1},{"year":"2016","papers":2},{"year":"2017","papers":2},{"year":"2018","papers":4},{"year":"2019","papers":14},{"year":"2020","papers":10},{"year":"2021","papers":12},{"year":"2022","papers":8},{"year":"2023","papers":9},{"year":"2024","papers":14},{"year":"2025","papers":12}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/l1-regularization"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}