比较全面的L1和L2正则化的解释

2024-04-22 17:45:57

前言

前段时间写了一篇文章《深入理解线性回归算法（二）：正则项的详细分析》，文章提到L1是通过稀疏参数（减少参数的数量）来降低复杂度，L2是通过减小参数值的大小来降低复杂度。网上关于L1和L2正则化降低复杂度的解释五花八门，易让人混淆，看完各种版本的解释后过几天又全部忘记了。因此，文章的内容总结了网上各种版本的解释，并加上了自己的理解，希望对大家有所帮助。

目录

1、优化角度分析

2、梯度角度分析

3、先验概率角度分析

4、知乎点赞最多的图形角度分析

5、限制条件角度分析

6.、PRML的图形角度分析

7、总结

1、优化角度分析

1、L2正则化的优化角度分析

在限定的区域，找到使

最小的值。

图形表示为：

上图所示，红色实线是正则项区域的边界，蓝色实线是

的等高线，越靠里的等高圆，

越小，梯度的反方向是

减小最大的方向，用

表示，正则项边界的法向量用实黑色箭头表示。

正则项边界在点P1的切向量有

负梯度方向的分量，所以该点会有往相邻的等高虚线圆运动的趋势；当P1点移动到P2点，正则项边界在点P2的切向量与

梯度方向的向量垂直，即该点没有往负梯度方向运动的趋势；所以P2点是

最小的点。

结论：L2正则化项使

值最小时对应的参数变小。

2、L1正则化的优化角度分析

在限定的区域，找到使

最小的值。

结论：如上图，因为切向量始终指向w2轴，所以L1正则化容易使参数为0，即特征稀疏化。

2、梯度角度分析

1、L1正则化

L1正则化的损失函数为：

上式可知，当w大于0时，更新的参数w变小；当w小于0时，更新的参数w变大；所以，L1正则化容易使参数变为0，即特征稀疏化。

2、L2正则化

L2正则化的损失函数为：

由上式可知，正则化的更新参数相比于未含正则项的更新参数多了

项，当w趋向于0时，参数减小的非常缓慢，因此L2正则化使参数减小到很小的范围，但不为0。

3、

先验概率角度分析

文章《深入理解线性回归算法（二）：正则项的详细分析》提到，当先验分布是拉普拉斯分布时，正则化项为L1范数；当先验分布是高斯分布时，正则化项为L2范数。本节通过先验分布来推断L1正则化和L2正则化的性质。

画高斯分布和拉普拉斯分布图（来自知乎某网友）：

由上图可知，拉普拉斯分布在参数w=0点的概率最高，因此L1正则化相比于L2正则化更容易使参数为0；高斯分布在零附近的概率较大，因此L2正则化相比于L1正则化更容易使参数分布在一个很小的范围内。

4、知乎点赞最多的图形角度分析

函数极值的判断定理：

（1）当该点导数存在，且该导数等于零时，则该点为极值点；

（2）当该点导数不存在，左导数和右导数的符号相异时，则该点为极值点。

如下面两图：

左图对应第一种情况的极值，右图对应第二种情况的极值。本节的思想就是用了第二种极值的思想，只要证明参数w在0附近的左导数和右导数符合相异，等价于参数w在0取得了极值。

图形角度分析

损失函数L如下：

黑色点为极值点x1，由极值定义：L'(x1)=0；

含L2正则化的损失函数:

由结论可定性的画含L2正则化的图：

极值点为黄色点，即正则化L2模型的参数变小了。

含L1正则化的损失函数:

因此，只要C满足推论的条件，则损失函数在0点取极值(粉红色曲线），即L1正则化模型参数个数减少了。

5、限制条件法

这种思想还是来自知乎的，觉得很有趣，所以就记录在这篇文章了，思想用到了凸函数的性质。我就直接粘贴这种推导了，若有不懂的地方请微信我。

结论：含L1正则化的损失函数在0点取得极值的条件比相应的L2正则化要宽松的多，所以，L1正则化更容易得到稀疏解（w=0）。

6、PRML的图形角度分析

因为L1正则化在零点附近具有很明显的棱角，L2正则化则在零附近比较平缓。所以L1正则化更容易使参数为零，L2正则化则减小参数值，如下图。

（1）L1正则化使参数为零（2）L2正则化使参数减小

7、总结

本文总结了自己在网上看到的各种角度分析L1正则化和L2正则化降低复杂度的问题，希望这篇文章能够给大家平时在检索相关问题时带来一点帮助。若有更好的想法，期待您的精彩回复，文章若有不足之处，欢迎更正指出。

参考：

https://www.zhihu.com/question/37096933

林轩田老师《机器学习基石》

赞 (0)

【AI白身境】入行AI需要什么数学基础：左手矩阵论，右手微积分

今天是新专栏<AI白身境>的第九篇,所谓白身,就是什么都不会,还没有进入角色. 咱们这个系列接近尾声了,今天来讲一个非常重要的话题,也是很多的小伙伴们关心的问题.要从事AI行业,吃这碗饭, ...
深度学习入门（7）

参考原文链接
DL一（ML基础知识）

基础知识ML 在进行深度学习前,根据学习网站的建议,首先学习机器学习的基础课程,学习资料主要是Andrew讲的ShortVideo,网址:http://openclassroom.stanford.e ...
导数与三角函数五大命题热点解析，不得不看！

命题点一借助导数研究三角函数的单调性奇偶性,对称性问题角度一:单调性题目涉及到三角函数在某个区间上单调,求参数的取值范围.可以利用导数与单调性的关系进行求解.若f(x)在(a,b)上单调递增, ...
深度学习补缺补漏篇！准算法工程师总结出的超强面经（含答案）

作者丨灯会来源丨极市平台编辑丨极市平台极市导读作者灯会为21届中部985研究生,七月份将入职某互联网大厂cv算法工程师.在去年灰飞烟灭的算法求职季中,经过几十场不同公司以及不同部门的面试中积累 ...
线性回归中的L1与L2正则化

在这篇文章中,我将介绍一个与回归相关的常见技术面试问题,我自己也经常会提到这个问题: 描述回归建模中的L1和L2正则化方法. 在处理复杂数据时,我们往往会创建复杂的模型.太复杂并不总是好的.过于复杂的 ...
很全面的26 种肿瘤标志物及其临床意义

肿瘤标志物(tumor marker,TM)很多,但每个指标什么意义,那个适用于什么肿瘤呢?笔者对其进行了总结,希望对大家有所帮助. 一些常见.通用的肿瘤血清 TM CEA(癌胚抗原) 空腔脏器来源, ...
收藏！最全面的“引经药”讲解（附歌诀）

引经药是指能导引诸药直达病所,增强疗效的药物,亦可理解为对机体某一部位有特殊作用的药物,是引经药的主要作用之一,这也是有别于西医用药的观点,中医治风湿病很重视引经药. 引经药又称引经报使药,其源远流长 ...
最全面的“反三违”培训知识手册！节后全员学习必备

第一部分"三违"的识别和预防一.违章指挥的识别与预防二.识别和预防违章操作行为三.违反劳动纪律第二部分习惯性违章的成因与防范一.习惯性违章的成因二.反习惯性违章的特点 ...
红色官窑瓷收藏指南，最全面的567瓷底款款识

567瓷是建国后由国家兴办的十大瓷厂在50年代到90年代生产的瓷器,是那个年代中国乃至全球的最高制瓷水准,成为时代绝响.近年来567瓷红色官窑瓷器拍卖价格不断攀升,很多古董商手上的567瓷出手价格接连 ...
最全面的28种分析工具

最全面的28种分析工具
DeFi是金融业的未来,史上最全面的DeFi学习资料！【收藏】

第一集:DeFi是什么? 第二集:DeFi诞生的意义! 第三集:DeFi的借贷模式有哪些? 第四集:DeFi的流动性挖矿是什么? 第五集:DeFi世界的去中心化交易所! 第六集:DeFi什么是自动做市 ...
图解最全面的135均线战法一旦学会再也不担心

股人云:"A股,是一个投机的市场." 机会,没有绝对的大小之分,关键在于把握.善于把握机会的投资者,没有机会能创造机会,小机会能变成大机会,藏匿再深的机会也逃不过他们的眼睛:不善于 ...
收藏！最全面的“引经药”讲解（附歌诀）|柴胡|黄连|白芷|黄芩|黄柏

引经药是指能导引诸药直达病所,增强疗效的药物,亦可理解为对机体某一部位有特殊作用的药物,是引经药的主要作用之一,这也是有别于西医用药的观点,中医治风湿病很重视引经药. 引经药又称引经报使药,其源远流长 ...