学习 深度学习6-LeNet-5与AlexNet总结
一、LeNet-5
LeNet-5是由Yann LeCun等人于1989年提出的卷积神经网络(CNN),是最早实现商业化应用的CNN模型之一,核心用于手写数字识别(MNIST数据集),为后续卷积神经网络的发展奠定了基础。
1. 核心结构
LeNet-5整体由“卷积层+池化层”交替堆叠,再连接全连接层构成,具体结构如下:
网络整体层级:2层卷积层(Conv)+ 2层池化层(Pool)+ 3层全连接层(FC)
“-5”的含义:特指网络中包含5层含可训练参数的层,即2层卷积层 + 3层全连接层(池化层无训练参数,仅做下采样)
卷积层均采用5×5卷积核,步长为1;池化层采用2×2池化窗口,步长为2,实现特征下采样,减少参数数量
2. 关键特点
激活函数:所有隐藏层均采用sigmoid激活函数,用于引入非线性,但其存在梯度消失问题,限制了网络深度
池化方式:采用平均池化,对池化窗口内的特征值取平均,保留特征的整体趋势,减少过拟合
核心优势:结构简洁、参数较少,适配当时的硬件条件,成功实现手写数字的高效识别,验证了CNN在图像识别任务中的有效性
二、AlexNet
AlexNet由Alex Krizhevsky等人于2012年提出,是CNN发展史上的里程碑式模型,首次在ImageNet图像分类任务中取得远超传统方法的成绩,推动了深度学习在计算机视觉领域的爆发式发展。其核心是在LeNet-5的基础上,针对复杂图像识别任务进行了多方面优化,解决了LeNet-5在深层网络中梯度消失、泛化能力弱等问题。
1. 核心结构
AlexNet包含8层含可训练参数的层,具体为5层卷积层 + 3层全连接层,相比LeNet-5,网络更深、参数更多,适配高分辨率图像(224×224×3)的识别需求。
2. 相比LeNet-5的核心改进
大幅增加网络参数与深度:AlexNet参数总量约6000万(LeNet-5仅约6万),网络深度更深,能够捕捉更复杂的图像特征,适配自然图像(而非简单手写数字)的识别需求。
激活函数替换为ReLU:摒弃LeNet-5的sigmoid激活函数,采用ReLU(修正线性单元),有效解决了深层网络中的梯度消失问题,同时计算速度更快,能支撑更深网络的训练。
引入Dropout正则化:核心作用是减少过拟合,提升模型泛化能力。具体实现:在每轮网络前向传播时,随机让约20%的神经元“失活”(暂时断开与后续层的连接),反向传播时,失活神经元的参数不更新;训练结束后,所有神经元正常参与预测,通过这种方式避免神经元过度依赖某一特征,降低过拟合风险。
池化方式改为最大池化:替换LeNet-5的平均池化,采用2×2最大池化(窗口2×2,步长2),能够保留图像中更关键的局部特征(如边缘、纹理),提升特征提取的有效性,同时进一步减少参数数量。
引入数据扩增技术:针对训练数据不足的问题,通过数据扩增提升模型泛化能力,核心方式包括:
水平翻转:将图像水平镜像,增加样本多样性,避免模型对图像方向的过度依赖
随机裁剪:从原始图像中随机裁剪出224×224的区域,提升模型对图像局部特征的识别能力
PCA颜色增强:对图像的RGB通道进行主成分分析(PCA),添加随机扰动,减少光照、颜 色变化对模型的影响
引入LRN局部响应归一化:全称Local Response Normalization,根据通道进行局部归一化处理。核心作用是增强模型的泛化能力,通过对同一位置、不同通道的特征值进行归一化,抑制反馈较小的神经元,突出反馈较大的神经元,提升特征的区分度
更多推荐

所有评论(0)