深度学习前传:从感知机到第三次AI寒冬,60年沉浮史比小说还精彩
深度学习前传:从感知机到第三次AI寒冬,60年沉浮史比小说还精彩
前两天面了个AI岗,面试官上来就问我:你知道神经网络最早是哪年提出的吗?我当场就懵了,搞AI快三年,天天调参炼丹,居然连祖师爷是谁都不知道。回去恶补了一周AI发展史,才发现这行业这60年起起落落,比爽文还刺激,好几次差点就没了,能活到今天真的太不容易了。今天就给大家唠唠深度学习诞生前的那段黑暗历史,看懂了才明白为什么现在大模型爆发不是偶然,是攒了60年的技术才堆出来的。
1. 起源:1943年,第一个神经元诞生了
很多人以为AI是最近十年才有的东西,其实早在二战还没打完的时候,科学家就已经在琢磨怎么造个大脑了。
1943年,心理学家麦卡洛克和数学家皮茨发表了一篇论文,提出了MCP神经元模型,就是模拟生物神经元的工作原理:接收多个输入,加权求和之后过个阈值,输出0或者1。
你敢信?这玩意就是现在所有大模型最最底层的基础单元,现在GPT-5里的几万亿个参数,本质上就是这个东西堆出来的。
不过这玩意刚出来的时候,大家都觉得很牛逼,觉得很快就能造出能思考的机器了,毕竟大脑不就是一堆神经元拼起来的吗?拼多了不就有智慧了?事实证明大家想简单了,这一等就是十几年。
2. 第一次热潮:1958年感知机诞生,AI元年开启
1958年,康奈尔大学的罗森布拉特发明了感知机,在MCP神经元的基础上加了权重和学习能力,第一次实现了可以自动学习的神经网络。
当时这个东西火到什么程度?美国海军直接投钱研究,说感知机以后能自动识别物体,以后不用人操作军舰。当时媒体直接吹:十年内AI就能超过人类。
你看,70年前大家就已经开始吹AI超越人类了,现在的媒体那都是玩剩下的。
不过好景不长,1969年,AI之父明斯基和佩吉特写了本书叫《感知机》,直接给这个热潮泼了一盆零下一百度的冰水。
书里直接证明了:感知机只能解决线性可分问题,连个XOR异或问题都解决不了,而且多层感知机的话,当时的计算机根本算不动。
这本书的结论直接给整个AI领域判了死刑:神经网络这条路走不通,大家别研究了。
这就是第一次AI寒冬,之后十几年几乎没人敢碰神经网络,经费全砍,论文都没人敢发,搞神经网络的都不好意思说自己是搞AI的。
3. 第一次复兴:反向传播救活神经网络,第二次热潮到来
这一熬就熬到了80年代,几个大佬憋出来了两个大招,直接把神经网络救活了。
第一个大招是1986年,辛顿、鲁梅尔哈特和威廉姆斯发表了反向传播算法,完美解决了多层神经网络的训练问题,之前大家不知道怎么调多层的权重,现在有了反向传播,就能训练深层网络了。
第二个大招是1989年,燕乐存搞出来了第一个卷积神经网络LeNet,用来识别手写数字,准确率直接干到了98%,当时用在邮政系统自动识别邮编,直接商用了。
当时大家又激动了,觉得AI马上就要成了,各种专家系统、神经网络项目疯狂上马,企业砸钱砸的比现在大模型热潮还凶。
不过好景又不长,到了90年代末,大家又发现不对了:
❌ 神经网络太吃算力了,当时的CPU根本跑不动深层网络,最多搞个3、5层就顶天了
❌ 数据太少了,没那么多数据训练大网络
❌ 效果不如传统机器学习算法好,SVM、随机森林这些算法效果比神经网络还好,还快,还省算力
然后第二次AI寒冬又来了,神经网络又成了冷门方向,辛顿大佬那些年投论文都经常被拒,大家都觉得神经网络是玄学,没用。
这一冷就冷到了2012年,直到AlexNet横空出世,直接一脚踢开了深度学习的新时代。
4. 为什么说AI的发展是螺旋上升的?
我看完这60年的历史,最大的感受就是:没有哪项技术是一帆风顺的,都是起起落落,攒够了技术、算力、数据,才能迎来爆发。
你看:
- 50年代感知机出来,算力不够,算法不够,凉了
- 80年代反向传播出来,数据不够,算力还是不够,又凉了
- 2012年,GPU普及了,互联网攒了大量数据,算法也成熟了,直接爆发了
- 现在大模型爆发,也是攒了十几年深度学习技术,加上GPU算力爆炸,互联网海量数据,三者凑齐了才有的结果
那些说AI是泡沫的,根本没看过历史,AI已经凉过好几次了,每次凉了之后都攒了更多技术,下次爆发只会更猛。
写在最后
很多刚入行的同学都喜欢赶热点,今天学大模型,明天学AI Agent,却很少有人去看这些基础历史。我反而觉得了解发展历史才是最重要的,看懂了过去的发展路径,你才能判断未来的方向,知道什么技术是真的有前途的,什么是炒作的。
下一篇我就给大家讲2012年的AlexNet到底是怎么一脚踢开深度学习新时代的,它的那几个创新点现在看平平无奇,在当时简直是降维打击。
觉得有用的别忘了点赞关注哦,有什么问题评论区留言我都会回😘
更多推荐



所有评论(0)