机器学习正则化超详细讲解(重点吃透 L1、L2)
机器学习正则化超详细讲解(重点吃透 L1、L2)
先铺垫基础,再拆原理、区别、优缺点、适用场景,全程不讲晦涩推导,只讲能听懂、能记住、会用的逻辑。
一、先重温核心:为什么需要正则化?
1. 过拟合本质
模型太复杂(特征太多、曲线弯来弯去),不仅学了数据真实规律,还把数据里的噪声、随机误差、脏数据全都当成规律学进去了。
- 训练集:准确率爆炸,几乎零误差
- 测试集 / 新数据:拉胯到离谱,泛化能力极差
2. 正则化的核心思想
原来的损失函数只看:预测值和真实值差多少
正则化多加了一项:惩罚模型参数权重
公式人话版:
总损失 = 预测误差 + 权重惩罚项
意思:
不光要预测准,还不能让权重太大;权重一大,就给模型扣分,逼着模型收敛、变简单,抑制过拟合。
二、L2 正则化(岭回归 Ridge)
1. 数学简单理解
惩罚方式:所有权重先平方,再求和
惩罚项:(\sum w_i^2)
2. 核心作用(人话)
把所有特征的权重都往 0 身边拉小,但永远不会精确等于 0。
3. 举例子秒懂
假设你预测房价,有一堆特征:
房子面积、楼层、朝向、小区垃圾桶数量、楼下树的棵数……
- 面积、楼层是有用特征,权重应该大
- 垃圾桶数量、树的棵数是无用噪声特征
不加正则:模型会给垃圾桶、树 分配很大权重,强行拟合噪声 → 过拟合。
加 L2 正则:
把所有特征权重整体压小,无用特征权重被压得很小很小,影响力几乎可以忽略,但不会直接变成 0 删掉。
4. L2 三大特点
- 不做特征删除,保留所有特征,只是削弱不重要特征
- 权重分布很平滑,不会极端偏大偏小
- 对异常值、噪声容忍更好,模型更稳定
- 工业界最常用,线性回归、逻辑回归、神经网络默认都用 L2
5. 缺点
不能自动筛选特征,特征太多时模型依然复杂。
三、L1 正则化(Lasso)
1. 数学简单理解
惩罚方式:所有权重取绝对值,再求和
惩罚项:(\sum |w_i|)
2. 核心作用(人话)
有强制归零效果:
不重要的特征,权重直接被压成 0,等于自动删掉这个特征;
只保留少数重要特征有非零权重。
3. 同样房价例子
加 L1 正则:
垃圾桶数量、树的棵数这些没用特征,直接权重 = 0 → 相当于从模型里剔除
只剩下面积、楼层这些核心特征干活。
4. L1 三大特点
- 自带特征筛选,自动剔除冗余、无用特征
- 产出稀疏模型:大部分权重都是 0,只有少部分有效特征
- 高维数据(特征特别多)特别好用
5. 缺点
- 容易受异常值影响大
- 多个特征高度相关时,只会随机保留其中一个,不稳定
- 不可导,求解比 L2 麻烦
四、一张表彻底分清 L1 vs L2
| 对比维度 | L1 正则 (Lasso) | L2 正则 (Ridge) |
|---|---|---|
| 惩罚方式 | 权重绝对值之和 | 权重平方之和 |
| 权重变化 | 可直接压缩到 0 | 只靠近 0,不会等于 0 |
| 特征处理 | 自动筛选、删无用特征 | 保留全部特征,只削弱权重 |
| 模型形态 | 稀疏模型 | 平滑稠密模型 |
| 抗噪声能力 | 弱,敏感 | 强,更稳定 |
| 适用场景 | 特征超多、需要降维选特征 | 常规防过拟合、神经网络、通用场景 |
五、还有一个:L1+L2 弹性网(Elastic Net)
有时候单独 L1 不稳定、单独 L2 不能选特征,就两个一起用:
既有 L1 的特征筛选,又有 L2 的平滑稳定。
适合:特征高度相关、数据维度特别高的场景。
六、正则化参数 λ(惩罚系数)到底怎么理解
λ 就是惩罚力度旋钮:
-
λ 越大
惩罚越狠 → 权重被压得越小 → 模型越简单
太大容易
欠拟合
:连真实规律都学不会了
-
λ 越小
惩罚越弱 → 模型放飞自我 → 容易
过拟合
-
λ = 0
没有任何正则化,纯靠原始损失,放任过拟合
比喻:
λ= 严管班主任:管太死,学生不敢发挥(欠拟合)
λ= 放养家长:完全不管,学生乱学跑偏(过拟合)
调参就是找最合适的管教力度。
七、一句话终极总结
- 正则化:给模型权重加惩罚,限制复杂度,专治过拟合
- L1:绝对值惩罚 → 权重可归零 → 自动删特征、做筛选
- L2:平方惩罚 → 权重只缩小不归零 → 平滑稳定、通用防过拟合
- 日常干活优先用 L2;特征太多想自动降维再用 L1;不稳就用 L1+L2
更多推荐

所有评论(0)