机器学习正则化超详细讲解(重点吃透 L1、L2)

先铺垫基础,再拆原理、区别、优缺点、适用场景,全程不讲晦涩推导,只讲能听懂、能记住、会用的逻辑。

一、先重温核心:为什么需要正则化?

1. 过拟合本质

模型太复杂(特征太多、曲线弯来弯去),不仅学了数据真实规律,还把数据里的噪声、随机误差、脏数据全都当成规律学进去了。

  • 训练集:准确率爆炸,几乎零误差
  • 测试集 / 新数据:拉胯到离谱,泛化能力极差

2. 正则化的核心思想

原来的损失函数只看:预测值和真实值差多少

正则化多加了一项:惩罚模型参数权重

公式人话版:

总损失 = 预测误差 + 权重惩罚项

意思:

不光要预测准,还不能让权重太大;权重一大,就给模型扣分,逼着模型收敛、变简单,抑制过拟合。


二、L2 正则化(岭回归 Ridge)

1. 数学简单理解

惩罚方式:所有权重先平方,再求和

惩罚项:(\sum w_i^2)

2. 核心作用(人话)

所有特征的权重都往 0 身边拉小但永远不会精确等于 0

3. 举例子秒懂

假设你预测房价,有一堆特征:

房子面积、楼层、朝向、小区垃圾桶数量、楼下树的棵数……

  • 面积、楼层是有用特征,权重应该大
  • 垃圾桶数量、树的棵数是无用噪声特征

不加正则:模型会给垃圾桶、树 分配很大权重,强行拟合噪声 → 过拟合。

L2 正则

把所有特征权重整体压小,无用特征权重被压得很小很小,影响力几乎可以忽略,但不会直接变成 0 删掉。

4. L2 三大特点

  1. 不做特征删除,保留所有特征,只是削弱不重要特征
  2. 权重分布很平滑,不会极端偏大偏小
  3. 异常值、噪声容忍更好,模型更稳定
  4. 工业界最常用,线性回归、逻辑回归、神经网络默认都用 L2

5. 缺点

不能自动筛选特征,特征太多时模型依然复杂。


三、L1 正则化(Lasso)

1. 数学简单理解

惩罚方式:所有权重取绝对值,再求和

惩罚项:(\sum |w_i|)

2. 核心作用(人话)

强制归零效果

不重要的特征,权重直接被压成 0,等于自动删掉这个特征

只保留少数重要特征有非零权重。

3. 同样房价例子

L1 正则

垃圾桶数量、树的棵数这些没用特征,直接权重 = 0 → 相当于从模型里剔除

只剩下面积、楼层这些核心特征干活。

4. L1 三大特点

  1. 自带特征筛选,自动剔除冗余、无用特征
  2. 产出稀疏模型:大部分权重都是 0,只有少部分有效特征
  3. 高维数据(特征特别多)特别好用

5. 缺点

  1. 容易受异常值影响
  2. 多个特征高度相关时,只会随机保留其中一个,不稳定
  3. 不可导,求解比 L2 麻烦

四、一张表彻底分清 L1 vs L2

对比维度 L1 正则 (Lasso) L2 正则 (Ridge)
惩罚方式 权重绝对值之和 权重平方之和
权重变化 可直接压缩到 0 只靠近 0,不会等于 0
特征处理 自动筛选、删无用特征 保留全部特征,只削弱权重
模型形态 稀疏模型 平滑稠密模型
抗噪声能力 弱,敏感 强,更稳定
适用场景 特征超多、需要降维选特征 常规防过拟合、神经网络、通用场景

五、还有一个:L1+L2 弹性网(Elastic Net)

有时候单独 L1 不稳定、单独 L2 不能选特征,就两个一起用

既有 L1 的特征筛选,又有 L2 的平滑稳定

适合:特征高度相关、数据维度特别高的场景。


六、正则化参数 λ(惩罚系数)到底怎么理解

λ 就是惩罚力度旋钮

  1. λ 越大

    惩罚越狠 → 权重被压得越小 → 模型越简单

    太大容易

    欠拟合

    :连真实规律都学不会了

  2. λ 越小

    惩罚越弱 → 模型放飞自我 → 容易

    过拟合

  3. λ = 0

    没有任何正则化,纯靠原始损失,放任过拟合

比喻:

λ= 严管班主任:管太死,学生不敢发挥(欠拟合)

λ= 放养家长:完全不管,学生乱学跑偏(过拟合)

调参就是找最合适的管教力度


七、一句话终极总结

  1. 正则化:给模型权重加惩罚,限制复杂度,专治过拟合
  2. L1:绝对值惩罚 → 权重可归零 → 自动删特征、做筛选
  3. L2:平方惩罚 → 权重只缩小不归零 → 平滑稳定、通用防过拟合
  4. 日常干活优先用 L2;特征太多想自动降维再用 L1;不稳就用 L1+L2
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐