Week 4:深度学习训练优化、正则化与梯度优化器
Abstract
This week, based on the fully connected neural networks, forward and backward propagation learned in the third week, I systematically studied the core training optimization technologies of deep learning. The main contents include underfitting and overfitting mechanisms, L1 and L2 regularization theories, mini-batch training strategies, and advanced gradient optimizers including Momentum, RMSprop and Adam. This study solves key practical problems such as unstable training and poor generalization of deep networks, improves the theoretical system of deep learning, and lays a solid foundation for the subsequent study of convolutional neural networks.
中文摘要:本周在第三周全连接神经网络、前向与反向传播的基础上,进阶学习深度学习模型训练优化的核心知识。主要研究深度网络欠拟合与过拟合的形成机理、L1与L2正则化约束原理、小批量梯度下降训练机制,以及Momentum、RMSprop、Adam等主流进阶优化器。本周内容有效解决了深度网络训练不稳定、泛化能力弱、收敛效率低等实战问题,完善了深度学习理论体系,为后续卷积神经网络的学习与模型调参奠定了扎实基础。
1 学习目标
1. 理解深度神经网络欠拟合、过拟合的成因与特征,掌握基于训练集、测试集误差的拟合状态判别方法,明晰偏差与方差的制衡关系。
2. 掌握L1、L2正则化的数学公式、约束机制与原理差异,能够通过正则化策略抑制模型过拟合、提升泛化能力。
3. 掌握全量、随机、小批量三类梯度下降的运算逻辑,理解Batch Size对模型训练速度、梯度稳定性与收敛效果的影响。
4. 熟练掌握Momentum、RMSprop、Adam优化器的迭代公式与自适应优化原理,明确各优化器的优势与适用场景。
2 学习日志
2.1 深度模型拟合状态分析
在上周全连接神经网络与正反传播理论的基础上,本周重点学习深度神经网络的训练优化与调优方法,主要解决深层模型拟合异常、梯度不稳定、收敛效率低、泛化能力差等实战问题,系统梳理模型拟合机制、正则化约束、批量训练与进阶优化器的核心原理。
欠拟合属于模型高偏差问题,成因是网络层数过浅、参数量不足或训练迭代不充分,模型拟合能力有限,无法捕捉数据潜在特征规律。核心表现为训练集与测试集误差均偏高,模型整体精度不足、拟合效果差。
过拟合属于模型高方差问题,是深度网络的常见缺陷。深层网络参数量庞大、拟合能力过强,容易过度学习训练集噪声、特例与冗余特征,导致模型过度依赖训练数据。典型特征为训练集损失极低、测试集损失显著升高,模型泛化能力大幅下降。
基于偏差-方差权衡理论,深度学习训练的核心目标是平衡模型拟合能力与泛化能力,通过各类优化策略规避欠拟合与过拟合,让模型在训练集和测试集上均保持稳定性能。
2.2 正则化原理与数学推导(L1、L2)
正则化是抑制过拟合、提升模型泛化能力的核心方法,核心思想是在原始损失函数中增加参数约束项,惩罚冗余权重、简化模型参数分布,避免模型过度拟合训练集噪声。
原始无正则化的损失函数为:

L2正则化(权重衰减)是深度学习最常用的正则化方式,通过约束权重的平方和实现参数衰减,整体损失函数更新为:
![]()
其中
为正则化超参数,用于控制惩罚强度。L2正则化会在参数迭代中持续衰减权重数值,使参数分布平滑稳定,有效抑制过拟合,且不产生参数稀疏性,适配绝大多数深度学习训练场景。
L1正则化基于参数绝对值之和构建约束项,损失函数公式为:

L1正则化可产生参数稀疏性,自动将无效权重压缩至0,实现特征筛选与降维,适用于高冗余特征场景。但其梯度更新稳定性较差,在深层深度网络中应用较少。
2.3 批量训练机制
本周对比了三类梯度下降训练模式:全量梯度下降参数更新平稳但计算量巨大;随机梯度下降训练速度快但梯度震荡严重、收敛不稳定。二者均不适合深层大数据模型训练。
因此深度学习统一采用小批量梯度下降,将数据集划分为若干批次,每次迭代仅使用一小批样本计算梯度、更新参数,兼顾训练速度与收敛稳定性。其梯度更新公式为:

其中 m 为批次样本数(Batch Size)。小批量梯度下降兼顾训练效率与梯度稳定性,是深度学习的标准训练方式。适度的批次噪声可帮助模型跳出局部最优解,有效提升模型泛化能力。
2.4 深度学习进阶优化器(重点拓展)
传统梯度下降存在学习率固定、收敛缓慢、易陷入局部最优等缺陷,无法适配深层网络训练。因此本周重点学习三类主流自适应优化器,掌握深度学习高阶参数迭代与优化逻辑。
1. 动量梯度下降(Momentum)
核心原理是模拟物理惯性,累积历史梯度更新方向,加速同向梯度收敛、抑制梯度震荡,有效解决深度网络训练收敛缓慢的问题。公式如下:

为动量系数,通常取0.9。动量法依托历史梯度惯性加速收敛、抑制震荡,有效提升深层网络的训练稳定性与收敛速度。
2. RMSprop优化器
针对固定学习率无法适配不同参数更新节奏的问题,RMSprop通过累积梯度平方值,动态调整每个参数的学习率,缓解梯度消失与震荡问题:

该机制可为不同参数动态分配学习率:对频繁更新参数降学习率、对稀疏参数升学习率,适配深度网络多参数差异化优化需求,有效缓解梯度震荡与收敛停滞问题。
3. Adam优化器(主流最优优化器)
Adam融合动量法与RMSprop的双重优势,同时累积梯度一阶矩(动量)与二阶矩(梯度平方),实现极致的自适应优化,是目前深度学习模型的默认优化器。核心公式:

Adam优化器融合动量法与RMSprop的双重优势,具备自适应学习率与梯度平滑能力,能够高效解决深层网络梯度不稳定、收敛慢、易陷入局部最优等问题,是目前深度学习通用的最优优化器。
2.5 深度网络训练综合调优策略
结合本周优化策略与上周神经网络基础知识点,我总结出一套适配深度网络的综合调优方案。深度模型训练问题复杂多样,需根据拟合状态、梯度表现、收敛情况组合优化,实现模型性能最优。
针对欠拟合问题,可通过加深网络层数、增加神经元数量、选用ReLU激活函数、适当调大学习率、增加迭代次数、降低正则化系数的组合策略,提升模型表征能力,解决高偏差问题。
针对过拟合问题,主要采用L2正则化权重衰减、合理调整Batch Size、精简冗余网络参数、搭配Adam优化器稳定参数更新的方式,平滑参数分布、抑制噪声拟合,有效提升模型泛化能力。
针对梯度消失与梯度爆炸问题,可统一使用ReLU激活函数、搭配标准化权重初始化、配合梯度裁剪与Momentum动量优化,稳定梯度传播过程,从根源解决深层梯度异常问题。
针对收敛缓慢、梯度震荡、局部最优问题,可按需选用小批量梯度下降、Momentum、RMSprop与Adam优化策略,自适应调整参数更新节奏,加速收敛并帮助模型逼近全局最优解。
综上,深度网络训练的核心是平衡模型拟合能力与泛化能力、收敛速度与训练稳定性。通过本周学习,我可精准诊断模型训练问题,灵活搭配各类调优策略,形成完整的深度学习训练调试思维。
3 学习成果
1. 掌握深度网络欠拟合、过拟合的成因与判别方法,能够结合偏差-方差理论分析模型拟合缺陷,具备基础的模型性能诊断能力。
2. 熟练掌握L1、L2正则化数学原理与约束特性,能够合理选用正则化策略抑制过拟合,提升模型泛化性能。
3. 明晰三类梯度下降模式的优劣,理解Batch Size对模型训练的影响,掌握深度学习标准小批量训练方法。
4. 精通Momentum、RMSprop、Adam优化器的迭代公式与自适应优化逻辑,熟练应用高阶优化器解决深度网络训练难题。
5. 串联前三周神经网络基础知识点,构建起模型搭建、前向反向传播、误差诊断、正则约束、参数优化的完整深度学习知识闭环。
6. 掌握深度网络全套综合调优方法,可针对性解决梯度异常、拟合失衡、收敛震荡等问题,显著提升深度学习模型训练与实战调参能力。
4 本周总结
本周承接第三周神经网络基础内容,聚焦深度学习训练优化核心,系统学习正则化、小批量训练与主流自适应优化器,结合数学公式吃透深度网络调优的底层逻辑,有效解决了深层模型训练的各类实战难点,知识体系连贯且实用性强,顺利完成机器学习向深度学习进阶的过渡学习。
更多推荐



所有评论(0)