对于AI:AI的科普
开篇介绍:
打开手机,你可以让 AI 帮你写文案、做 PPT;对着智能音箱说一句话,它就能帮你控制家电、设置闹钟;开车时,辅助驾驶系统能帮你识别路况、自动跟车;甚至你想学习一门新技术、解决一个专业问题,AI 都能给你清晰的讲解和可行的方案。
今天,人工智能已经从科幻电影里的概念,变成了我们每天都在接触、都在使用的工具。但很多人每天都在用 AI,却依然对它充满疑惑:AI 到底是什么?它为什么能听懂人话、写代码、生成图片?它的 “智能” 到底是怎么来的?它未来会发展成什么样?我们会不会被 AI 取代?
本篇博客,我们就来探讨一下
第一章 到底什么是人工智能?—— 从本质区分 AI 与普通程序
在聊 AI 的技术和发展之前,我们首先要搞清楚一个最核心的问题:到底什么是人工智能?
很多人对 AI 的第一印象,是电影里那些有自我意识、能思考、有感情、能和人一样做所有事情的机器人。但现实里,我们今天接触到的所有 AI,包括 ChatGPT、DeepSeek、文心一言这些最先进的大模型,都属于弱人工智能(狭义人工智能)—— 它们是专门处理特定任务的智能工具,而不是有自我意识的 “人造人”。
人工智能,英文名为 Artificial Intelligence,简称 AI,它是计算机科学的一个核心分支,核心目标是让计算机或机器,能够模仿人类的思维和行为模式,具备看、听、说、学习、推理、决策的能力,从一个只会死板执行固定命令的工具,变成能理解需求、解决问题、服务人类的智慧伙伴。
很多人会问:AI 和我们平时用的普通程序,到底有什么不一样?不都是代码写出来的吗?
这是一个非常关键的问题,理解了这个区别,你就理解了 AI 最核心的本质。
我们平时用的普通程序,核心逻辑是规则先行,执行规则。比如你用计算器,输入 1+1,它输出 2,这背后是程序员提前写死的规则:如果输入加法运算,就把两个数字相加,返回结果。普通程序的所有行为,都来自于程序员提前定义好的一条条规则,它只会严格执行这些规则,一旦遇到规则里没有覆盖的情况,就会直接报错,完全无法处理。
就像你想让一个普通程序识别图片里的狗,你要给它写成千上万条规则:如果图片里有湿润的黑鼻子,就加 10 分;如果有耷拉的耳朵,加 8 分;如果有卷起来的尾巴,加 7 分;如果有翅膀,扣 100 分…… 最后根据总分判断是不是狗。但现实里,狗的形态千变万化,有的狗是侧面的,看不到鼻子;有的狗耳朵折起来了;有的狗被衣服盖住了,只露出一个头。只要你的规则里没覆盖到,程序就认不出来了。
而 AI 的核心逻辑,是数据先行,学习规律,自主决策。AI 不是靠程序员提前写死的规则,而是靠 “学习” 来获得能力。还是识别狗的例子,你不用给 AI 写任何规则,只需要给它成千上万张标好标签的图片 —— 哪些是狗,哪些不是狗。AI 会自己从这些海量的图片里,总结出 “狗到底长什么样” 的本质规律,然后遇到新的、它从来没见过的图片时,它就能根据自己学到的规律,自主判断这张图里有没有狗。
这就是 AI 和普通程序最本质的区别:普通程序是 “教一句,会一句”,规则之外的事情,完全做不了;而 AI 是 “给它海量的例子,它自己学会方法”,能处理规则之外的、全新的、不确定的问题。
AI 的能力边界,很大程度上取决于它学习的数据,和它学习的方法。就像人一样,你读的书越多、经历的事情越多,你的认知和解决问题的能力就越强;AI 也是一样,投喂给它的数据越多、质量越高,它学到的规律就越准确,能力就越强。
在这里,我们还要厘清三个大家经常听到,却很容易搞混的概念:AI、机器学习、深度学习。很多人会把这三个词混为一谈,但它们其实是包含与被包含的关系。
我们可以用一个通俗的类比来理解:AI 就像 “水果” 这个大的概念,它包含了各种各样实现智能的技术路径;而机器学习,就是水果里的 “苹果”,是实现 AI 最核心、最主流、效果最好的一种方法;而深度学习,就是苹果里的 “红富士”,是机器学习里的一个分支,也是现在应用最广、能力最强的技术。
我们现在看到的几乎所有酷炫的 AI 应用,不管是人脸识别、语音助手、自动驾驶,还是 ChatGPT 这类大语言模型,背后的核心技术,都是深度学习。它们的关系可以清晰地概括为:AI > 机器学习 > 深度学习,深度学习是当前实现人工智能的最强武器。
第二章 AI 的智能从哪来?—— 拆解机器学习与深度学习的底层逻辑
知道了 AI 的本质是 “从数据里学习规律”,那接下来大家最关心的问题就是:AI 到底是怎么学习的?机器学习和深度学习到底是怎么回事?神经网络真的是模仿人的大脑吗?
这一章,我们就用最通俗的例子,把 AI 学习的底层逻辑讲得明明白白,不用任何公式,就能让你彻底搞懂机器学习、深度学习、神经网络的核心原理。
一、机器学习:让机器从数据里学会解决问题
机器学习,顾名思义,就是让机器具备像人一样的学习能力,通过数据和经验,自动提升自己完成任务的能力。它的核心思路,就是不用人为写死规则,而是让算法自己从数据里,找到解决问题的规律。
我们还是用 “识别图片里的狗” 这个最直观的例子,来看看传统机器学习的完整流程,你就能明白机器学习到底是怎么工作的。
用传统机器学习方法让机器学会认狗,一共分为四个核心步骤:
第一步,人工提取特征。什么是特征?就是能区分 “狗” 和 “非狗” 的关键信息。就像教小朋友认狗,你会告诉他,狗有湿润的鼻子、两只耳朵、四条腿、一条尾巴,会汪汪叫。教机器也是一样,我们需要先给机器定义好,判断是不是狗,要检查哪些核心特征:比如鼻子的形状和颜色、耳朵的位置和形态、尾巴的姿态、有没有胡须、毛发的纹理、眼睛的形状等等。这些特征,都是人提前给机器定义好的,机器自己不会主动寻找。
第二步,选择合适的机器学习模型。模型是什么?通俗点说,就是一套数学家们已经设计好的、能从数据里学习规律的数学框架。它就像一个空的水壶,我们把数据和特征倒进去,它就能按照固定的流程,把数据里的规律 “熬” 出来。不同的模型,适合解决不同的问题:有的模型适合做分类任务,比如识别是狗还是猫、是垃圾邮件还是正常邮件;有的模型适合做预测任务,比如预测明天的天气、下个月的房价;有的模型适合做推荐任务,比如短视频平台给你推什么内容。
第三步,训练模型。我们把提前准备好的成千上万张图片喂给模型,每张图片,我们都已经用之前定义好的特征描述清楚了,同时给图片打上了标签:“这是狗” 或者 “这不是狗”。模型就会在这些数据里,反复地学习、调整、验证,总结出 “符合这些特征的,大概率是狗” 的规律。比如,它会通过学习发现,有湿润黑鼻子、尖耳朵、卷尾巴的样本,99% 都是狗;而有长鼻子、大耳朵、会飞的样本,基本都不是狗。这个学习、调整的过程,就是我们常说的 “模型训练”。
第四步,用训练好的模型做预测。当模型学完了所有的训练数据,我们就得到了一个 “学会认狗” 的模型。这时候,我们给它一张它从来没见过的新图片,它就会按照自己学到的规律,去检查这张图片里的特征,然后给出自己的判断:这张图里的东西,符合狗的特征,所以它是狗。
但是,传统的机器学习,有一个非常致命的局限性:它极度依赖 “人工提取特征”。特征选得好不好、全不全,直接决定了模型的能力上限。
就像教小朋友认狗,如果你只告诉他 “狗有四条腿”,那他看到猫、牛、羊,都会觉得是狗,因为你给的特征太片面了。而且现实世界的情况是千变万化的:一张狗的图片是侧面的,看不到鼻子;狗的耳朵折起来了,看不到耳朵的形状;狗被衣服盖住了,只露出一个头。这时候,我们提前人工定义的那些特征,就失效了,机器就认不出来这是狗了。
这就像一个学生,只会死记硬背老师划的重点,考试的时候题目稍微变一下,换个问法,他就不会做了。传统机器学习的能力,被人为定义的特征牢牢限制住了,很难处理复杂的、多变的真实世界的问题。
那怎么解决这个问题?这就轮到深度学习登场了。深度学习的出现,彻底打破了 “人工提取特征” 的束缚,让 AI 的能力实现了质的飞跃。
二、深度学习:让机器自己学会找最本质的特征
深度学习,是机器学习的一个分支,它的核心载体是深度神经网络,而它最革命性的突破,就是彻底摆脱了对人工提取特征的依赖,能让机器自己从最原始的数据里,自动学习到最本质、最有用的特征。
还是用识别狗的例子,用深度学习的方法,流程和传统机器学习完全不一样,也简单得多:
第一步,端到端的学习。我们不用再给机器定义任何特征,不用告诉它要检查鼻子、耳朵、尾巴。我们只需要把最原始的图片数据 —— 也就是图片里每个像素点的颜色、亮度信息,和图片的标签(“这是狗”“这不是狗”),直接扔给一个叫做 “神经网络” 的模型就可以了。剩下的事情,都交给模型自己来做。
第二步,自动提取层级化的特征。这个神经网络,结构非常复杂,有很多很多层,所以我们叫它 “深度” 神经网络,深度学习的名字就是这么来的。它会自己从最原始的像素数据里,一层一层地、由简单到复杂、由局部到整体地,自动学习出狗的特征,完全不用人工干预。
- 在最底层的网络里,它会先学会识别最基础的视觉元素:比如图片里的边缘、角落、线条、颜色块。就像小朋友学画画,先学会画直线、曲线、圆圈这些最基础的笔画。
- 到了中间层,它会把底层学到的这些简单元素组合起来,学会识别更复杂的结构:比如纹理、圆形的眼睛、三角形的耳朵、椭圆形的鼻子。就像小朋友把线条和圆圈组合起来,画出眼睛、耳朵、鼻子这些面部部件。
- 到了最高层,它会把中间层学到的这些部件再组合起来,形成对 “狗” 这个东西的整体抽象概念:比如狗脸的结构、狗的身体形态,甚至不同品种狗的共同特征。
第三步,预测判断。当这个深度神经网络训练完成后,再给它一张新的图片,不管是正面的、侧面的、被遮挡的、姿势奇怪的狗,它都能动用自己从底层到高层学到的这套完整的特征体系,做出准确的判断。
为什么深度学习的识别能力,比传统机器学习强得多?因为它学到的不是我们人为规定的 “鼻子、耳朵” 这些表面特征,而是 “狗” 这个东西最本质的视觉特征。哪怕外观有变化,只要核心的本质特征符合,它就能识别出来。就像一个真正理解了知识点的学生,不管题目怎么变,他都能抓住核心考点,做出正确的解答。
我们可以再用一个更生活化的例子,彻底分清机器学习和深度学习的区别。比如,我们要教一个人学会判断 “什么样的水果是西瓜”。
传统机器学习的方法,就是我们提前给他定下死规则:西瓜是绿色的、有深绿色的条纹、形状是圆的、拍起来有咚咚的声音、果肉是红色的、有黑色的籽。他就死记硬背这些规则,去市场上找符合这些规则的水果。但如果遇到一个黄皮的西瓜、无籽的西瓜、椭圆形的西瓜,他就懵了,因为这些不符合他记住的规则。
深度学习的方法,就是我们不给他讲任何规则,直接给他拉来一卡车西瓜,再拉来一卡车不是西瓜的水果,让他自己一个一个看、一个一个摸、一个一个尝。他自己看了成千上万的西瓜之后,就会自己总结出西瓜的核心特征,不管是黄皮的、绿皮的、圆的、椭圆的、有籽的、无籽的,他一眼就能认出来,这是西瓜。
这就是深度学习最强大的地方:它能自己从数据里,学到事物最本质的规律,而不是依赖人为定义的、片面的规则。也正因为如此,它才能处理真实世界里复杂、多变、不确定的问题,让 AI 的能力实现了革命性的突破。
三、神经网络:深度学习的核心,到底是怎么工作的?
我们一直在说神经网络,很多人会觉得这个词很神秘,听起来很高深。其实,神经网络的设计灵感,就来自于我们人类大脑里的神经元网络,它的工作逻辑,和我们人做决策的逻辑,几乎一模一样。
我们人类的大脑里,有大约 860 亿个神经元,这些神经元之间互相连接,传递信号。我们的思考、记忆、感知、决策,本质上都是这些神经元之间的信号传递和处理。科学家们就模仿生物神经元的工作方式,设计出了人工神经元模型,再把成千上万、甚至上万亿个人工神经元连接起来,就形成了人工神经网络。
那一个人工神经元,到底是怎么工作的?我们用一个非常具体、非常贴近生活的例子,把它拆解得明明白白。比如,我们现在要做一个决策:要不要劝身边的同学去投实习简历。我们把这个决策任务,交给一个人工神经元来完成,看看它是怎么思考、怎么做出决策的。
一个人工神经元,有五个核心的组成部分:输入、权重、求和、激活函数、输出。我们一个一个来讲,每个部分到底是做什么的。
第一个部分:输入。输入,就是我们做决策时,需要考虑的所有相关信息。就像我们大脑里,从眼睛、耳朵接收到的外界信息,或者从记忆里提取的经验信息。在 “要不要劝同学找实习” 这个决策里,我们的输入有四个:
- 输入 1:同学的知识储备现状。他已经学完了核心的专业课程,还自己做过几个完整的小项目,具备了岗位需要的基础能力。
- 输入 2:实习经历的重要性。有没有相关的实习经历,对校招找工作的影响非常大,大厂的实习经历,能极大提高简历的通过率。
- 输入 3:时间窗口的优势。同学现在处于大二大三阶段,正是找暑期实习的黄金时间,暑期实习表现好,很容易拿到转正 offer,直接解决毕业就业的问题,不用和几百万人挤秋招。
- 输入 4:同学的心理阻力。他总觉得自己没复习好,很多知识点忘了,不敢投简历,有畏难和拖延的心态。
第二个部分:权重。权重,就是每个输入的信息,对最终决策的重要程度。我们做决策的时候,不是所有信息都一样重要的:有的信息是决定性的,能直接推动我们做决定;有的信息是次要的,影响不大;还有的信息是负面的,会阻碍我们做决策。
权重就是用来衡量这个重要程度的:权重的数值越大,说明这个输入对决策的影响越大;权重是正数,说明这个信息是正向的,会推动我们做出决策;权重是负数,说明这个信息是负向的,会阻碍我们做出决策。
在这个例子里,我们给每个输入设置对应的权重:
- 输入 1(知识储备)的权重:+7。这是极强的正向权重,因为这些核心技能和项目经历,是企业招实习生最看重的核心资本。
- 输入 2(实习经历重要性)的权重:+8。也是极强的正向权重,因为企业在招聘时,非常看重候选人的相关实践经历。
- 输入 3(时间窗口)的权重:+9。这是最高的正向权重,因为大二大三的暑期实习,是成本最低、收益最高的实习机会,错过这个窗口期,后面的机会会少很多。
- 输入 4(心理阻力)的权重:-5。这是负向权重,因为自我怀疑和拖延,会阻碍我们做出 “去投实习” 的决策,但是这个阻力的影响,远不如前面几个正向因素的影响大。
第三个部分:求和。求和的逻辑非常简单,就是把每个输入的信息,乘以它对应的权重,然后把所有的结果加起来,得到一个综合的总分。这个总分,就代表了所有信息综合起来,对决策的整体影响是正向还是负向,力度有多大。
我们来算一下这个例子里的总分:(1×7)+(1×8)+(1×9)+(1×−5)=7+8+9−5=19这里的 1,代表这个输入是成立的、真实存在的,比如 “同学有足够的知识储备” 这件事是真的,所以输入值是 1。
第四个部分:激活函数。激活函数,通俗点说,就是一个 “决策开关”。我们人类大脑里的生物神经元,也是这样工作的:当接收到的信号强度超过某个阈值的时候,神经元就会被 “激活”,把信号传递给下一个神经元;如果信号强度没超过阈值,神经元就不会被激活,也不会传递信号。
在我们这个例子里,我们给这个神经元设置的激活阈值是 15。也就是说,当求和得到的总分超过 15 的时候,这个神经元就会被激活,做出 “要劝同学去投实习” 的决策;如果总分没超过 15,就不激活,做出 “暂时不用劝” 的决策。
我们刚才算出来的总分是 19,明显超过了 15 的阈值,所以这个神经元就会被激活。
第五个部分:输出。输出,就是神经元最终做出的决策结果。在这个例子里,输出就是 “去劝同学投实习简历”。
你看,一个人工神经元的工作过程,是不是和我们人做决策的过程,几乎一模一样?我们平时做任何决定,都是先收集相关的信息,然后判断每个信息的重要程度,综合权衡所有信息的利弊,最后再做出 “做” 还是 “不做” 的决定。人工神经元,就是把我们人类的这个决策过程,用数学的方式模拟了出来。
而这个小小的人工神经元模型,就是后来所有人工神经网络、深度学习,甚至今天的大语言模型的最底层基石。我们现在看到的所有强大的 AI,不管是能识别图片的 AI,还是能和人流畅聊天的 AI,本质上,都是由成千上万、甚至上万亿个这样的人工神经元,连接成的巨大的、多层的神经网络。
单个的神经元,只能做简单的 “是或否” 的决策,但是当我们把大量的神经元,一层一层地连接起来,形成一个深度的神经网络,它就能处理极其复杂的问题。比如,识别一张图片里的狗,底层的神经元负责识别线条和边缘,中间层的神经元负责识别眼睛、耳朵这些部件,高层的神经元负责识别狗的整体形态。每一层的神经元,都把自己处理后的结果,传递给下一层的神经元,一层一层处理,最后就得到了最终的判断结果。
这就像一个工厂的流水线:第一个车间把原材料加工成基础零件,第二个车间把零件组装成功能部件,第三个车间把部件组装成成品,最后完成出厂。深度神经网络的工作逻辑,和这个流水线非常相似,每一层负责处理一部分任务,把信息加工得更抽象、更高级,最后完成复杂的识别、理解、生成任务。
第三章 人工智能的百年征途 —— 从千年想象到大模型时代
很多人觉得,AI 是最近几年才出现的新东西,是 ChatGPT 带火的。但其实,人类对 “人造智能” 的想象和探索,已经有了几千年的历史;而现代人工智能的理论和技术发展,也已经走过了近百年的历程。
了解 AI 的发展史,我们才能更清楚地知道,AI 是怎么一步步走到今天的,它的每一次突破和低谷,背后的原因是什么,也能让我们更理性地看待今天的 AI 热潮,不被夸大的言论裹挟,也不低估它带来的变革。
一、千年萌芽:人类对 “人造智能” 的古老想象
人工智能的技术,是现代计算机科学的产物,但人类对 “能模仿人类行为的人造物” 的想象和向往,从几千年前就开始了。
早在中国的战国时期,《列子・汤问》里就记载了一个非常有名的故事 ——《偃师献技》。故事里说,有一个叫偃师的工匠,给周穆王献上了一个他自己亲手制造的 “倡者”,也就是歌舞艺人。这个假人,能唱歌、能跳舞,动作、神态和真人一模一样,甚至在表演的时候,还对周穆王的妃子眉目传情。
周穆王勃然大怒,以为偃师用真人骗他,要治他的罪。偃师赶紧把这个假人拆开给周穆王看,大家才发现,这个假人里面,全都是用皮革、木头、胶漆、颜料做的机关,心脏、肝脏、肾脏、肠胃、筋骨、关节,样样俱全。把这些零件拼起来,就又是一个活灵活现的假人。周穆王看完之后,惊叹不已,说:“人之巧乃可与造化者同功乎?”—— 人的技艺,竟然能和创造万物的天地一样厉害吗?
这个两千多年前的故事,就是人类对 “人造智能” 最早的想象和向往。我们的祖先,就已经希望能造出一个能模仿人类行为、有自主动作能力的人造物了。
在西方的历史里,也有很多类似的想象:古希腊神话里,火神赫菲斯托斯制造的自动机器人;中世纪欧洲,工匠们制作的能自动行走、行礼的机械人偶;工业革命时期,能写字、画画、下棋的自动机械装置。这些,都是人类对 “人造智能” 的探索,只不过,那个时候的人们,只能用机械的方式,实现一些固定的、重复的动作,离真正的 “智能”,还有十万八千里的距离。
真正的人工智能,要等到计算机科学诞生之后,才有了实现的可能。
二、理论奠基(1936-1956):从数学理论到 “人工智能” 的诞生
人工智能的诞生,不是凭空出现的,它是建立在数学、逻辑学、计算机科学、神经科学等多个学科的重大突破之上的。在这个阶段,有几个关键的人物和里程碑式的突破,为人工智能的诞生,打下了最坚实的地基。
第一个关键人物,就是阿兰・图灵,被后世称为 “计算机科学之父”“人工智能之父”。1936 年,年仅 24 岁的图灵,发表了一篇划时代的论文 ——《论可计算数及其在判定问题中的应用》。在这篇论文里,他提出了一个抽象的数学计算模型,也就是后来大名鼎鼎的图灵机。
什么是图灵机?简单来说,图灵机不是一个真实的机器,而是一个数学上的理论模型。它证明了,只要有一套合适的规则,就可以用一个通用的机器,模拟任何的计算过程。我们今天所有的电脑、手机、服务器,本质上都是图灵机的物理实现。
图灵机的提出,不仅为现代计算机的发明奠定了理论基础,也为人工智能提供了最核心的前提:如果机器能实现任何计算过程,那它能不能模拟人类的思考和推理过程?因为人类的思考和推理,本质上也是一种信息处理和计算的过程。这个问题,正是人工智能研究的起点。
1943 年,神经科学和数学领域,也出现了一个关键的突破。神经学家沃伦・麦卡洛克和数学家沃尔特・皮茨,联合发表了一篇论文,提出了世界上第一个人工神经元模型,也就是我们上一章里讲的神经元模型的雏形。
他们用数学的方法,模拟了生物神经元的工作机制,证明了哪怕是非常简单的人工神经网络,也能实现基本的逻辑运算,比如 “与、或、非” 这些最基础的逻辑判断。这个模型,直接打开了用机器模拟人类大脑神经网络的大门,成为了后来所有神经网络和深度学习技术的起点。
1950 年,图灵又发表了一篇足以载入史册的论文,叫《计算机与智能》,后来也被重新命名为《机器能够思考吗?》。在这篇论文里,图灵提出了一个非常经典、直到今天还在被广泛讨论的问题:机器能思考吗?
为了回答这个问题,图灵设计了一个著名的测试,也就是图灵测试。这个测试的设计非常巧妙,它避开了 “什么是思考”“什么是智能” 这种哲学上永远争论不清的问题,而是用一个非常实用的标准,来判断机器有没有智能:别管机器内部是怎么运作的,只要它的行为表现,和人类的智能行为无法区分,那我们就可以认为,这台机器是有智能的。
我们来详细说说图灵测试到底是怎么回事。图灵测试的场景是这样的:有一个测试者,是一个普通人;还有两个被测试的对象,一个是真人,另一个是运行着智能程序的计算机。这两个被测试的对象,都在测试者看不见的房间里,测试者只能通过文字聊天的方式,和他们交流。
测试者可以问任何问题,不管是数学题、生活常识、情感问题,还是编故事、开玩笑,都可以。两个被测试者,都要通过文字回答测试者的问题。测试的目标,就是让测试者通过对话,判断出哪个是真人,哪个是机器。如果在足够多的测试之后,测试者经常把机器误判成真人,也就是说,机器成功地 “欺骗” 了测试者,让测试者觉得它是一个真人,那我们就说,这台机器通过了图灵测试。
我们可以举个很直观的例子:你向两个房间的对象提问:1234567 + 7654321 等于多少?A 房间的对象立刻回答你:等于 8888888。B 房间的对象回答你:我现在不想算这个,换个话题吧。你觉得哪个是真人,哪个是机器?
很多人会觉得,A 是机器,B 是真人。因为真人会偷懒、会不想算数,而机器会立刻给出精准的答案。你看,图灵测试的核心,不是看机器能不能算得快、记得多,而是看它能不能表现出和人类一样的、自然的、有温度的行为和对话。
图灵测试的提出,给人工智能的研究,定下了一个非常明确的目标:让机器的行为,和人类的智能行为无法区分。直到今天,这个目标依然是很多 AI 研究者追求的方向。而 ChatGPT 这类大语言模型的出现,让很多人觉得,它们已经非常接近通过图灵测试了。
有了理论基础,有了计算机这个物理载体,人工智能的诞生,就只差临门一脚了。这一脚,就是 1956 年的达特茅斯会议。
1956 年夏天,在美国的达特茅斯学院,一群当时最聪明、最顶尖的年轻科学家,聚在一起开了一个为期两个月的学术研讨会。这群人里,有后来被称为 “人工智能之父” 的约翰・麦卡锡,有信息论的创始人克劳德・香农,有人工智能领域的泰斗马文・明斯基、赫伯特・西蒙、艾伦・纽厄尔等等,几乎每一个,都是后来计算机科学和人工智能领域的传奇人物。
这次会议的主题,就是 “试图让机器精确模拟人类的学习、推理,以及其他所有的智能行为”。在这次会议上,约翰・麦卡锡首次提出了 “人工智能”(Artificial Intelligence) 这个词。从此,“人工智能” 正式成为了一个独立的学科,有了自己的名字、自己的研究目标、自己的学术圈子。
所以,1956 年的达特茅斯会议,被公认为是人工智能正式诞生的元年,这次会议也被很多人叫做 “AI 的宪法会议”。在会议的提案里,这群年轻的科学家们,充满了雄心壮志,他们乐观地认为,只要用一个夏天的时间,就能在人工智能的核心问题上,取得重大的突破。他们甚至预言,在一代人的时间里,创造人工智能的问题,就能被基本解决。
现在回头看,我们会发现,当时的科学家们,还是低估了实现人工智能的难度。但不可否认的是,这次会议,正式开启了人工智能的时代。
三、早期繁荣与第一次寒冬(1956-1980):从黄金时代到坠入低谷
达特茅斯会议之后,人工智能的研究,进入了第一个黄金发展期。在这十几年里,AI 领域出现了一个又一个令人惊喜的突破,整个学术界和资本界,都对 AI 充满了乐观的期待,觉得通用人工智能的实现,近在眼前。
我们来看看这个时期,AI 都取得了哪些标志性的成就:
1959 年,亚瑟・塞缪尔开发出了世界上第一个能自主学习的程序 —— 西洋跳棋程序。这个程序最厉害的地方在于,它不是靠程序员提前写死的规则来下棋,而是能自己和自己下棋,在对弈的过程中不断学习,总结下棋的规律,提升自己的棋力。最后,这个程序甚至战胜了美国当时的西洋跳棋州冠军。也是在这个时候,亚瑟・塞缪尔首次提出了“机器学习”这个概念,为 AI 的发展,开辟了一个全新的方向。
1966 年,麻省理工学院的约瑟夫・魏岑鲍姆,开发出了一个能处理自然语言的聊天程序,叫ELIZA。这个程序,是世界上第一个尝试进行图灵测试的程序,它能模拟一个心理咨询师的语气,和人进行对话。比如,你跟它说 “我最近很烦恼”,它会回复你 “你会经常感到烦恼吗?”;你说 “我的妈妈不理解我”,它会回复你 “你多和我说说你妈妈的事情?”。
很多和 ELIZA 聊天的人,都觉得这个程序真的能理解自己的情绪,甚至会对着它倾诉自己的心事。但其实,ELIZA 的原理非常简单,它只是做了简单的模式匹配和关键词提取,然后用固定的话术模板来回复,根本没有真正理解对话的内容。但即便如此,它也向世界展示了,机器和人类用自然语言交流,是有可能的。
1970 年,在日本的早稻田大学,世界上第一个拟人机器人WABOT-1诞生了。这个机器人,整合了肢体控制系统、视觉系统和自然语言对话系统,它能听懂简单的日语指令,能看到周围的环境,能走路,能抓取物体,甚至能和人进行简单的对话。这是人类第一次把视觉、听觉、运动、对话能力,整合到一个拟人化的机器人平台上,也确立了人形机器人这个研究领域的地位。
除了这些具体的成果,当时的 AI 研究者们,还在定理证明、问题求解、模式识别等很多领域,都取得了重大的突破。整个行业都弥漫着极度乐观的情绪,当时的很多顶尖科学家都做出了非常大胆的预言:比如,马文・明斯基在 1967 年说,“在一代人之内,创造人工智能的问题,就会被实质性地解决”;赫伯特・西蒙在 1958 年说,“在 10 年之内,计算机就将成为国际象棋的世界冠军”,“在 10 年之内,计算机就能写出能获得人类认可的文学作品”。
但现实,很快就给了所有人一盆冷水。当时的 AI 技术,能解决的,其实都是实验室里的、简单的、特定场景的问题,一旦遇到稍微复杂一点的、真实世界里的问题,就立刻捉襟见肘了。而科学家们之前的乐观预言,也一个都没有实现。
从 60 年代末开始,人工智能的发展,就开始遇到越来越多的瓶颈,而政府和资本对 AI 的耐心,也一点点耗尽了。最终,在 70 年代中期,人工智能迎来了它的第一次寒冬。
什么是 AI 的 “寒冬”?就是整个行业的研究经费被大幅削减,相关的项目被大量叫停,学术界对 AI 的研究热情骤降,很多年轻人都不敢再进入这个领域,整个 AI 行业陷入了长期的停滞和低谷。
那为什么会出现第一次 AI 寒冬?背后的原因,主要有这么几个:
第一个原因,也是最核心的原因:当时的 AI 技术,有无法突破的能力瓶颈。当时主流的 AI 技术,是基于规则的 “符号主义”,简单来说,就是程序员把人类的知识和逻辑,写成一条条的规则,让机器按照这些规则来推理和解决问题。但这种方法,有两个致命的缺陷:
- 首先,真实世界的问题,是无限复杂的,你不可能把所有的规则都提前写出来。比如,要让机器理解自然语言,一句话可以有无数种说法,同一个词在不同的语境里,意思完全不一样,你根本不可能把所有的语言规则都写死。
- 其次,当时的 AI,只能处理简单的、确定的问题,根本处理不了有不确定性、有噪声的真实数据。比如,当时的机器翻译项目,美国政府投入了大量的资金,希望能快速实现俄语和英语的自动翻译,结果发现,机器翻译出来的内容,错误百出,根本没法用,就是因为自然语言的复杂性,靠简单的规则翻译,根本行不通。
第二个原因,是计算能力的严重不足。当时的计算机,算力和今天比起来,差了好几个数量级。哪怕是一个非常简单的神经网络,当时的计算机都跑不起来,更别说处理复杂的问题了。很多理论上可行的方法,在当时的硬件条件下,根本无法实现。
第三个原因,是学术界和政府的质疑。随着之前的乐观预言一个个落空,大家发现,AI 好像并没有大家吹的那么厉害,能解决的问题非常有限。当时,英国的一个研究委员会,专门对 AI 的研究做了一个调查报告,报告里说,AI 的研究,并没有像研究者们承诺的那样,取得重大的突破,很多研究都是夸大其词。大西洋彼岸的美国,政府和军方也开始大幅削减 AI 的研究经费,很多之前投入巨资的 AI 项目,都被直接叫停了。
这几个原因交织在一起,让人工智能的发展,在 70 年代中期,直接坠入了寒冬。整个行业的研究经费锐减,大量的 AI 项目被砍掉,很多学者都转去研究别的领域了,只有少数的研究者,还在默默坚守。这个寒冬,一直持续了将近 10 年的时间。
四、复兴与第二次寒冬(1980-1993):从专家系统热潮到再次跌入谷底
第一次寒冬过后,到了 80 年代,人工智能迎来了一次短暂的复兴,而这次复兴的核心驱动力,就是专家系统的商业化落地。
什么是专家系统?简单来说,专家系统就是一套能模拟人类专家的决策能力的计算机程序。它的核心逻辑,就是把某个特定领域里的顶级专家的知识和经验,提取出来,写成一条条的 “如果 - 那么” 的规则,存到计算机的 “知识库” 里;然后再设计一个 “推理机”,能像专家的思维过程一样,根据用户输入的问题,去知识库里面查找匹配的规则,进行逻辑推理,最后给出和专家一样的建议和答案。
举个例子,比如医疗领域的专家系统,我们把顶级的内科医生的诊断经验,写成一条条规则:如果患者有发烧、咳嗽、流鼻涕的症状,那么大概率是上呼吸道感染;如果患者发烧超过 3 天,伴随有胸痛、咳黄痰,那么要考虑肺炎的可能,建议做胸片检查。把成千上万条这样的规则存到知识库里面,用户输入患者的症状,专家系统就能像医生一样,给出诊断建议和治疗方案。
专家系统和之前的 AI 技术最大的区别,就是它不再追求 “通用的人工智能”,而是聚焦在一个非常具体的、狭窄的专业领域里,解决这个领域里的特定问题。也正因为如此,它能真正落地到工业界、商业界,创造实际的商业价值,而不是只停留在实验室里。
在 80 年代,专家系统在很多行业都得到了非常成功的应用。比如,在制造业里,用专家系统做设备的故障诊断;在金融行业里,用专家系统做贷款的风险评估;在化工行业里,用专家系统做生产流程的控制和优化;在医疗行业里,用专家系统做疾病的辅助诊断。
很多大型企业,都开始投入巨资,开发自己的专家系统,因为它能极大地提升效率,降低成本。比如,当时的通用电气公司,用专家系统来诊断燃气轮机的故障,之前需要资深的工程师到现场才能解决的问题,现在用专家系统就能快速诊断,节省了大量的时间和成本。
专家系统的商业化成功,让整个行业对 AI 的信心又回来了。政府和资本,又开始重新给 AI 的研究投入资金,大学也纷纷开设了人工智能相关的专业,很多 AI 创业公司也应运而生,整个行业又热闹了起来。除了专家系统,机器学习的相关理论,也在这个时期有了新的发展,比如反向传播算法的提出,为神经网络的训练,提供了有效的方法,也为后来的深度学习埋下了伏笔。
但好景不长,到了 80 年代末、90 年代初,专家系统的局限性,也越来越明显地暴露了出来,AI 的第二次寒冬,也随之而来。
专家系统的问题,到底出在哪?主要有这么几个致命的缺陷:
- 第一,专家系统的开发和维护成本极高,而且扩展性极差。一个复杂一点的专家系统,里面有上万条、甚至几十万条规则,这些规则,都需要领域专家和程序员一起,一条一条地人工写进去,耗时耗力,成本极高。而且,一旦领域里的知识更新了,或者业务场景变了,就要人工去修改、添加规则,维护起来非常麻烦。更麻烦的是,当规则的数量多到一定程度,就会出现规则之间互相冲突、矛盾的问题,排查和解决这些问题,成本极高。
- 第二,专家系统无法自动学习新知识,能力上限被牢牢锁死。它的能力上限,就是给它写规则的那个专家的能力上限。它只能处理规则里覆盖到的问题,一旦遇到超出规则范围的情况,它就完全无能为力了,甚至会犯非常低级、非常荒唐的错误。它不会自己从新的案例里学习新的知识,也不会自己总结新的规律,就像一个只会死记硬背的书呆子,不会举一反三。
- 第三,硬件的变革,让专家系统失去了运行的载体。当时的专家系统,大多都是运行在专门的、昂贵的 AI 工作站上的。但随着个人计算机(PC)的快速发展,微型计算机的性能越来越强,价格越来越便宜,很快就超过了那些昂贵的 AI 工作站。大家发现,用便宜的 PC 就能完成的工作,根本没必要花大价钱去买专门的工作站,去维护复杂的专家系统。
随着这些问题的暴露,之前大量投入专家系统的企业,发现投入和产出完全不成正比,纷纷停止了相关的项目。大量的 AI 创业公司,因为没有持续的收入,纷纷破产倒闭,到 1993 年前后,有超过 300 家 AI 公司关门。资本对 AI 的热情,再次降到了冰点,政府也再次大幅削减了 AI 的研究经费,人工智能迎来了它的第二次寒冬。
这次寒冬,比第一次持续的时间更长,影响也更大。在很长一段时间里,“人工智能” 甚至成了一个贬义词,学术界的人都不敢说自己是研究人工智能的,怕被别人觉得是在吹牛、骗经费,纷纷把自己的研究方向,改叫 “机器学习”“数据挖掘”“模式识别”“计算机视觉”,避开 “人工智能” 这个词。
但值得庆幸的是,哪怕是在寒冬里,AI 的技术也并没有止步不前。很多研究者,依然在默默深耕,在计算机视觉、语音识别、数据挖掘、工业机器人等领域,取得了很多突破性的进展。更重要的是,1991 年,互联网开始出现并快速普及,让人类可以在线连接、共享海量的数据。而数据,正是人工智能的燃料,这在后来,成为了人工智能爆发的最关键的基础之一。
五、崛起与爆发(1993 年至今):从深度学习突破到大模型时代
熬过了第二次寒冬,人工智能的发展,进入了一个全新的时代。这一次,驱动 AI 崛起的,不再是基于规则的符号主义,也不是局限于特定领域的专家系统,而是我们之前讲过的,基于神经网络的深度学习。深度学习的出现,彻底改变了人工智能的发展轨迹,让 AI 的能力,实现了质的飞跃。
在这个长达 30 年的阶段里,有很多里程碑式的事件,我们一个一个来讲,看看 AI 是怎么一步步,从实验室里的技术,变成今天我们每个人都能用到的工具的。
里程碑 1:1997 年,“深蓝” 战胜国际象棋世界冠军1997 年,IBM 的 “深蓝” 超级计算机,战胜了当时的国际象棋世界冠军卡斯帕罗夫。这是人工智能第一次,在标准的国际象棋比赛里,击败了人类的世界冠军,这件事在当时震惊了全世界。
深蓝的核心,是强大的算力和搜索算法,它能每秒计算 2 亿步棋,能预判未来十几步的走法,通过穷举和评估,选出最优的走法。虽然深蓝的技术,和我们今天的深度学习 AI 不一样,但它让全世界都看到了,人工智能在复杂的决策任务里,完全有能力超越人类最顶尖的水平。
里程碑 2:2006 年,深度学习的理论奠基2006 年,被称为 “深度学习教父” 的杰弗里・辛顿,和他的同事们,发表了一篇划时代的论文 ——《用神经网络降低数据维数》。在这篇论文里,他们提出了深度置信网络的模型,解决了深度神经网络训练难的问题,证明了多层的神经网络,可以通过逐层预训练的方式,得到很好的训练效果。
这篇论文,被公认为是深度学习正式崛起的标志,也为后来深度学习的爆发,奠定了理论基础。从此,“深度学习” 这个词,开始进入大众的视野,神经网络的研究,也迎来了新的春天。
里程碑 3:2006 年,CUDA 的推出,解决了 AI 的算力瓶颈同样是 2006 年,英伟达公司,正式推出了CUDA(统一计算架构)。很多人说,没有 CUDA,就没有今天的 AI 大模型时代,这句话一点都不夸张。因为 CUDA 和 GPU,彻底解决了 AI 计算的算力瓶颈问题。
这里,我们要给大家讲清楚,GPU 到底是什么,它为什么能成为 AI 时代的算力核心,CPU 和 GPU 到底有什么区别。
我们先来说 CPU,也就是中央处理器,我们的电脑、手机里,都有 CPU。CPU 就像一个学识渊博、经验丰富的老教授,他非常聪明,能处理各种复杂的任务,比如运行操作系统、打开办公软件、处理复杂的逻辑运算。但是,CPU 的核心数很少,哪怕是现在最顶级的桌面 CPU,也就只有几十个核心,它一次只能同时处理几件事。就像这个老教授,虽然厉害,但一次只能给一个学生讲题,你让他去数一亿粒米,他能数得很精确,但速度会非常非常慢。
而 GPU,也就是图形处理器,它最初是为了电脑游戏里的图形渲染设计的。我们玩游戏的时候,屏幕上的每一个像素点,都要实时计算它的颜色、亮度、位置,这是海量的、简单的、重复的计算任务。为了完成这个任务,GPU 的设计思路,和 CPU 完全不一样。GPU 就像一万个小学生,每个小学生的能力都很有限,只能做非常简单的加减乘除运算,但是他们人多,能同时并行处理成千上万的计算任务。你让这一万个小学生去数一亿粒米,每个人分一点,很快就能数完。
而 AI 计算,尤其是深度学习的计算,本质上是什么?就是海量的、高度重复的矩阵乘法和加法运算。比如,我们要让 AI 识别一张图片里的猫,需要把图片里数百万个像素点的数值,和神经网络里数百万、甚至上亿个参数,进行大量的乘法和加法运算。这个过程,不需要复杂的逻辑推理,恰恰需要的是海量的、并行的简单计算。而 GPU 的架构,完美匹配了 AI 计算的需求。
但光有 GPU 硬件还不够,因为 GPU 最初是为图形渲染设计的,程序员很难用它来做通用的计算。而英伟达推出的 CUDA,就是解决这个问题的。CUDA 是一个完整的软件平台和编程模型,它让程序员可以用我们熟悉的 C++、Python 这些编程语言,直接调用 GPU 的强大算力,来做通用的并行计算,不用再去管复杂的图形渲染接口。
CUDA 的出现,相当于给这一万个小学生,配了一个能听懂人话的班主任,你只要告诉班主任要算什么,班主任就能把任务分配给所有小学生,让他们同时开工,快速完成计算。从此,GPU 不再只是用来玩游戏的显卡,而是变成了 AI 计算的核心算力载体。深度学习模型的训练速度,因为 GPU 和 CUDA 的出现,有了数量级的提升。之前用 CPU 要训练几个月的模型,用 GPU 几天、甚至几个小时就能训练完。
可以说,今天所有震撼世界的 AI 产品,不管是 ChatGPT、Gemini,还是能生成视频的 Sora,它们的训练和运行,都完全依赖于由数万甚至数十万颗 GPU 组成的超级计算机。没有 GPU 和 CUDA 带来的算力革命,就没有今天的深度学习,更没有今天的大模型时代。英伟达也因此,成为了 AI 时代的 “卖铲人”—— 当全世界都在疯狂淘金、开发 AI 应用的时候,英伟达提供了最好用、甚至是唯一的 “铲子”,也就是 GPU 和 CUDA 生态,成为了这一波 AI 浪潮里,最大的赢家之一。
里程碑 4:2012 年,AlexNet 夺冠,深度学习席卷计算机视觉2012 年,深度学习在计算机视觉领域,实现了革命性的突破。在当年的 ImageNet 图像识别大赛上,一个叫AlexNet的深度神经网络模型,以碾压级的优势,拿到了比赛的冠军。
ImageNet 大赛,是当时计算机视觉领域最权威的比赛,参赛的队伍,要用 AI 模型,对 120 万张图片进行分类,识别图片里的物体是猫、是狗、是车,还是别的东西。在 2012 年之前,参赛的队伍,大多用的是传统的机器学习方法,最好的成绩,错误率也在 26% 左右。
而 2012 年,辛顿的团队,用基于深度学习的 AlexNet 模型,把错误率直接降到了 15.3%,比第二名低了将近 11 个百分点,这是前所未有的突破。而且,AlexNet 用的,就是 GPU 来加速模型的训练,这也让整个行业,都看到了深度学习 + GPU 的巨大潜力。
AlexNet 的夺冠,就像一声惊雷,彻底点燃了深度学习的热潮。从此,深度学习在计算机视觉领域,快速取代了传统的机器学习方法,人脸识别、图像识别、目标检测、自动驾驶的视觉感知,所有的技术,都因为深度学习,实现了质的飞跃。
也是在这一年,谷歌的 “Google Brain” 项目,用 16000 个 CPU 核心,搭建了一个巨大的神经网络,在没有任何人工标注和先验知识的情况下,仅仅通过观看 YouTube 上的视频,就自发地学会了识别 “猫”。这个实验,也让工业界第一次,大规模地看到了深度学习的惊人潜力。
里程碑 5:2015 年,TensorFlow 发布,降低了深度学习的门槛2015 年,谷歌的 Google Brain 团队,正式发布了TensorFlow机器学习框架。TensorFlow 的出现,极大地降低了深度学习的开发门槛。
在这之前,要开发一个深度学习模型,需要程序员自己写大量的底层代码,实现神经网络的各种层、各种运算,门槛非常高。而 TensorFlow,提供了一整套完整的工具、库和资源,把深度学习里常用的模块、算法,都封装好了,开发者只需要用简单的代码,就能搭建、训练和部署自己的深度学习模型,不用再去关心底层的复杂实现。
除了 TensorFlow,后来 Meta(原 Facebook)也推出了PyTorch框架,因为它更灵活、更易用,很快就成为了学术界和工业界最主流的深度学习框架。这些框架的出现,让深度学习不再是少数顶尖实验室里的 “黑科技”,而是所有开发者都能学习、使用的工具,极大地推动了深度学习技术的普及和应用。
里程碑 6:2017 年,Transformer 架构提出,为大模型时代奠定基础2017 年,谷歌的 AI 团队,发表了一篇改变了整个 AI 领域的论文,标题叫《Attention Is All You Need》(注意力机制就是你需要的全部)。在这篇论文里,他们首次提出了Transformer 模型架构,彻底解决了之前序列模型(比如处理文本的 RNN、LSTM)的长距离依赖问题,而且非常适合用 GPU 进行并行计算,训练效率极高。
Transformer 架构的核心创新,就是自注意力机制。什么是自注意力机制?简单来说,就是让 AI 在处理文本的时候,能像人一样,关注一句话里最重要的词,并且能理解词和词之间的关系,哪怕它们离得很远。
比如,我们看一句话:“我把那个红色的杯子放在了桌子上,它昨天刚买的。” 我们人一眼就能知道,这里的 “它”,指的是前面的 “红色的杯子”,而不是 “桌子”。但之前的 AI 模型,很难处理这种长距离的指代关系,而 Transformer 的自注意力机制,就能完美解决这个问题。它能让模型在处理每个词的时候,都能关注到整个句子里的所有词,给每个相关的词分配不同的注意力权重,从而真正理解文本里的上下文关系和语义。
这篇论文发表之后,Transformer 架构迅速席卷了整个自然语言处理领域,然后又快速扩展到了计算机视觉、语音识别、多模态生成等几乎所有的 AI 领域。我们今天看到的所有大型语言模型,不管是 ChatGPT、GPT-4,还是 DeepSeek、文心一言、通义千问,它们的底层核心架构,都是 Transformer。
可以说,Transformer 的诞生,为后续所有的大语言模型,提供了最基础、最关键的架构蓝图,没有 Transformer,就没有今天的大模型时代。
里程碑 7:2016 年,AlphaGo 战胜李世石,让 AI 彻底破圈2016 年,谷歌 DeepMind 团队开发的AlphaGo,战胜了围棋世界冠军李世石。这件事,让人工智能彻底破圈,走进了普通大众的视野。
围棋,被称为人类智慧的最后堡垒,它的复杂度,和国际象棋完全不是一个量级的。国际象棋的可能走法,大约有 10 的 46 次方,而围棋的可能走法,有 10 的 170 次方,这是一个天文数字,根本不可能用深蓝那种穷举搜索的方式来解决。
而 AlphaGo 的核心,就是深度学习和强化学习。它通过学习数百万盘人类的围棋棋谱,然后自己和自己下无数盘棋,不断学习、优化,最终掌握了远超人类顶尖棋手的围棋能力。AlphaGo 战胜李世石之后,又推出了 AlphaGo Zero,它完全不学习人类的棋谱,只靠自己和自己下棋,从零开始学习,只用了几天的时间,就轻松战胜了之前战胜李世石的 AlphaGo 版本。
这让所有人都看到了,深度学习的强大学习能力,它能在规则明确的复杂决策领域里,完全超越人类的水平。AlphaGo 的胜利,让全世界的普通大众,都第一次真切地感受到了 AI 的强大,也让资本和企业,更加坚定地投入到 AI 的研发和应用中。
里程碑 8:2022 年,ChatGPT 发布,开启大模型时代2022 年 11 月 30 日,OpenAI 公司正式发布了ChatGPT。ChatGPT 的出现,彻底改变了 AI 行业的格局,也让 AI 从科技圈的技术,变成了全世界所有人都能接触、都能使用的工具。
在 ChatGPT 之前,其实已经有很多大语言模型了,比如 OpenAI 之前的 GPT-3,谷歌的 PaLM,国内的很多大模型。但这些模型,大多都只对开发者开放 API,或者只在实验室里,普通用户根本用不到,也不知道怎么用。而 ChatGPT,提供了一个极其简单、极其自然、免费的网页聊天界面,任何人,不管有没有技术背景,只要会打字,就能直接和它对话。
ChatGPT 的能力,也彻底震惊了所有人。它能写诗、写文案、写代码、解数学题、编故事、翻译、做 PPT 大纲、分析问题,甚至能帮你改简历、模拟面试,几乎你能想到的、和文字相关的任务,它都能完成。无数用户在社交平台上,分享自己和 ChatGPT 对话的截图,它的能力让所有人都感到震惊。发布短短 5 天,ChatGPT 的用户数就突破了 100 万,这是互联网历史上,用户增长最快的消费级产品。
ChatGPT 的爆发,彻底点燃了全球的大模型热潮。在此之后,全世界的科技巨头,包括谷歌、微软、Meta、亚马逊,还有中国的百度、阿里、腾讯、字节跳动、华为、深度求索等公司,全部加速入场,纷纷发布了自己的大语言模型,比如 Gemini、Claude、LLaMA、文心一言、通义千问、DeepSeek 大模型等等,形成了我们今天看到的 “百模大战” 的格局。
大模型的能力,也在以肉眼可见的速度快速进化。从只能处理文本,到能看懂图片、听懂语音,再到能生成图片、视频、3D 模型,能写代码、运行代码、调用工具,能完成复杂的多步骤任务。AI,正在从一个聊天机器人,变成一个能帮我们解决各种复杂问题的、全能的智能助手。
到这里,人工智能近百年的发展史,我们就完整地讲完了。从两千多年前偃师献技的古老想象,到图灵的理论奠基,到达特茅斯会议的正式诞生,到两次寒冬的低谷,到深度学习的崛起,再到今天大模型时代的爆发,人工智能的发展,从来都不是一帆风顺的,它经历了一次又一次的热潮和低谷,一次又一次的突破和质疑,才走到了今天。
了解这段历史,我们就能更理性地看待今天的 AI 热潮。我们既不用盲目乐观,觉得 AI 马上就要拥有自我意识,取代人类;也不用盲目悲观,觉得 AI 会抢走所有人的工作,让我们失业。AI 本质上,是人类创造出来的工具,是人类智慧的延伸,它的发展,最终还是为了服务人类,提升社会的生产力,让我们的生活变得更好。
第四章 AI 的技术版图与应用场景 ——AI 到底能做什么?
很多人对 AI 的认知,还停留在 ChatGPT 这类能聊天的大语言模型上。但其实,人工智能是一个非常庞大的学科,它有很多不同的技术分支,每个分支都有自己的研究方向和应用场景,覆盖了我们生活、工作、生产的方方面面。
这一章,我们就给大家讲清楚,AI 的主要技术领域有哪些,它们都能做什么,在我们的生活里,哪些地方用到了这些 AI 技术。
一、自然语言处理(NLP)—— 让机器能听懂、会说人类的语言
自然语言处理,英文叫 Natural Language Processing,简称 NLP,它是人工智能的一个核心分支,研究的目标,就是让计算机能理解、处理、生成人类的自然语言,实现人和机器之间,用自然语言进行顺畅的交流。
我们平时用的 ChatGPT、语音转文字、机器翻译、智能客服,背后的核心技术,都是自然语言处理。可以说,NLP 是 AI 和人交互的最核心的桥梁,因为我们人类最主要的交流方式,就是语言和文字。
自然语言处理的主要任务,包括这么几类:
1. 自然语言理解
自然语言理解,就是让机器读懂人类的语言,理解文本里的语义、情感、意图。这是所有 NLP 任务的基础,只有先理解了内容,才能做后续的处理和生成。
比如,你跟智能音箱说 “帮我定一个明天早上 8 点的闹钟”,机器要能理解你的意图是 “定闹钟”,时间是 “明天早上 8 点”,这就是自然语言理解要做的事。
再比如,电商平台里,AI 能自动分析用户的商品评价,判断这个评价是好评、中评还是差评,用户对商品的哪些地方满意,哪些地方不满意,这就是情感分析,也是自然语言理解的一个重要应用。
还有很多常见的理解类任务:比如命名实体识别,从文本里识别出人名、地名、公司名、时间、地点这些关键信息;比如关键词提取,从一篇长文章里,提取出最核心的几个关键词;比如文本分类,把新闻、文章分到对应的类别里,比如财经、体育、娱乐、科技等等。
2. 自然语言生成
自然语言生成,就是让机器自己生成通顺、符合要求、有逻辑的人类语言。这是现在大语言模型最核心的能力,也是我们接触最多的 NLP 能力。
我们现在用 ChatGPT 写文案、写邮件、写代码、写小说,本质上都是自然语言生成的能力。还有很多常见的应用场景:
- 机器翻译:把中文翻译成英文,把英文翻译成日文,本质上是先理解源语言的语义,再生成目标语言的文本,是理解和生成的结合。
- 自动摘要:给一篇几万字的长文档、一本厚书,AI 自动生成几百字的摘要,让你快速了解核心内容。
- 内容创作:写新闻稿、写文案、写诗歌、写剧本、写营销内容,都属于自然语言生成的范畴。
- 智能对话:智能客服、聊天机器人,能根据用户的问题,自动生成对应的回复,也是自然语言生成的重要应用。
3. 自然语言处理的常见应用
自然语言处理的应用,已经渗透到了我们生活的每一个角落:
- 我们手机里的输入法,会用 AI 联想你接下来要输入的词,纠正你的错别字,背后是 NLP 技术。
- 我们用的翻译软件、拍照翻译,背后是 NLP 的机器翻译技术。
- 我们刷短视频的时候,自动生成的字幕,是语音识别 + NLP 的结合。
- 我们给客服发消息,首先接待我们的智能客服,是 NLP 技术做的。
- 我们写文档、写邮件的时候,AI 帮我们纠错、润色、补全内容,也是 NLP 的能力。
- 企业里的智能合同审核、智能知识库、智能招聘简历筛选,背后也都是 NLP 技术。
而 ChatGPT 这类大语言模型,就是把自然语言理解和生成的能力,做到了前所未有的高度,让机器能和人进行多轮的、流畅的、有逻辑的对话,能理解复杂的指令,完成复杂的文本任务,彻底打破了人和机器之间的语言壁垒。
二、计算机视觉(CV)—— 让机器能 “看见” 世界,看懂图像和视频
计算机视觉,英文叫 Computer Vision,简称 CV,它也是人工智能最核心的分支之一,研究的目标,是让计算机能像人的眼睛一样,“看懂” 图像和视频里的内容,从像素数据里,提取出有用的信息,比如识别物体、识别人脸、理解场景、判断动作等等。
我们平时用的人脸识别、扫码支付、自动驾驶里的环境感知、手机里的 AI 拍照、美颜滤镜,背后的核心技术,都是计算机视觉。如果说 NLP 给了 AI “听懂人话” 的耳朵和嘴巴,那 CV 就给了 AI “看懂世界” 的眼睛。
计算机视觉的主要任务,包括这么几类:
1. 图像分类
图像分类,是计算机视觉最基础的任务,就是给一张图片,让 AI 判断这张图片里的内容是什么,属于哪个类别。比如,我们之前举的例子,识别图片里是狗还是猫,就是最典型的图像分类任务。
我们手机里的相册,会自动把照片按照 “风景”“人物”“美食”“宠物” 分类,用的就是图像分类技术。安防监控里,AI 判断画面里是有人、有车,还是有动物,也会用到图像分类。
2. 目标检测
目标检测,比图像分类更进一步:不仅要识别出图片里有什么物体,还要定位出这个物体在图片里的位置,用方框标出来。
比如,自动驾驶里,AI 要从摄像头拍摄的画面里,识别出路上的行人、车辆、红绿灯、交通标志、护栏,还要知道它们在什么位置,离车有多远,这就是目标检测最核心的应用。
还有很多常见的场景:安防监控里,AI 自动识别画面里有没有人闯入、有没有危险行为;我们拍照的时候,手机相机会自动识别人脸,对焦到人的脸上;外卖平台里,AI 识别骑手有没有佩戴头盔、有没有违规骑行,都是目标检测的应用。
3. 图像分割
图像分割,比目标检测更精细,它要把图片里的每个像素,都分类到对应的物体上,相当于给图片里的每个物体,都描出精准的轮廓。
比如,在自动驾驶里,要把画面里的马路、人行道、绿化带、车辆、行人,都精准地分割出来,知道哪些区域是可以行驶的,哪些区域是不能碰的,这就需要用到图像分割技术。
还有我们非常熟悉的应用:手机拍照里的 “人像模式”,能把背景虚化,只把人拍清楚,就是用图像分割,把人和背景精准地分开。医疗影像里,AI 从 CT、核磁影像里,精准地分割出肿瘤、病灶的区域,也是图像分割最重要的应用场景之一。
4. 人脸识别
这是我们最熟悉的计算机视觉应用,已经融入了我们生活的方方面面。人脸识别是一套完整的技术流程,它包括:
- 人脸检测:先找到图片里的人脸在哪里;
- 人脸关键点检测:定位出眼睛、鼻子、嘴巴、脸部轮廓的关键点,比如人脸对齐、美颜滤镜,都会用到这个技术;
- 人脸特征提取:把人脸的特征,转换成一串独一无二的数字编码,也就是我们常说的 “人脸特征值”;
- 人脸比对:把提取到的特征,和数据库里的人脸特征对比,计算相似度,判断是不是同一个人。
我们每天都在用的手机人脸解锁、小区的人脸识别门禁、火车站的人脸识别检票、支付的时候刷脸支付,用的都是人脸识别技术。
5. 光学字符识别(OCR)
OCR 的核心目标,是让 AI 从图片里,识别出文字的内容,把图片里的文字,转换成可编辑的文本。
比如,我们用手机拍一张纸质文档的照片,就能把里面的文字提取出来,不用自己手动打字,这就是 OCR 最常见的应用。还有拍照翻译,拍一张外文的菜单、路牌、说明书,就能直接翻译成中文,也是先通过 OCR 识别出文字,再用机器翻译转换成中文。还有我们日常用的车牌识别,摄像头拍到汽车的车牌,就能自动识别出车牌号码,用的也是 OCR 技术。
6. 视频内容理解
视频内容理解,就是针对视频的 AI 处理,把计算机视觉技术,应用到连续的视频帧上,实现对视频内容的理解和分析。
比如,安防监控里,AI 自动检测视频里有没有人打架、有没有人摔倒、有没有火灾、有没有违规操作;短视频平台里,AI 自动识别视频里的内容,给视频打标签,做内容审核,判断视频里有没有违规的、不健康的内容;还有动作识别,比如 AI 健身教练,能通过摄像头,识别你健身的动作标不标准,告诉你哪里需要纠正,怎么改进。
计算机视觉的应用,已经无处不在了。从我们每天都在用的手机拍照、人脸解锁、扫码支付,到自动驾驶、智能安防、医疗影像诊断、工业质检、无人机巡检,再到 AI 画图、AI 生成视频,都离不开计算机视觉技术。可以说,计算机视觉,给机器装上了一双 “眼睛”,让它们能看见、看懂我们的世界。
三、语音处理技术 —— 让机器能 “听见” 声音,和我们语音对话
语音处理技术,也是 AI 的一个重要分支,它研究的是如何让计算机处理、理解、生成人类的语音信号,实现人和机器之间的语音交互。
我们平时用的智能音箱、手机里的语音助手、语音转文字、文字转语音、电话里的智能外呼,背后都是语音处理技术。如果说 NLP 是处理文字信息,那语音处理技术,就是处理声音信息,它让人和机器的交互,变得更简单、更自然,不用再动手打字,动动嘴就能完成任务。
语音处理的核心任务,主要有这么几类:
1. 自动语音识别(ASR)
自动语音识别,就是我们常说的 “语音转文字”,把人类的语音信号,转换成对应的文本内容。这是语音交互的第一步,机器要先把你说的话,转换成文字,才能理解你的指令和需求。
我们生活里到处都能看到 ASR 的应用:给微信好友发语音,能直接转换成文字,不用听语音,核心就是 ASR 技术;开会的时候,用录音软件把会议内容录下来,自动生成会议纪要,第一步就是用 ASR 把语音转成文字;智能音箱、手机里的语音助手,你跟它说话,它要先把你的语音转换成文字,才能理解你的指令;视频自动生成字幕,也是先把视频里的人声,通过 ASR 转换成文字,再做成字幕。
现在的 ASR 技术,已经非常成熟了,在安静的环境下,对标准普通话的识别准确率,能达到 98% 以上,甚至能识别很多种方言、带口音的普通话,还有英语、日语等多种外语。
2. 语音合成(TTS)
语音合成,和 ASR 正好相反,是 “文字转语音”,把文本内容,转换成自然、流畅、有感情的人类语音,让机器能开口说话。这是语音交互的第二步,机器理解了你的指令,生成了回复的文本,再用 TTS 转换成语音,播出来给你听。
我们身边的 TTS 应用也非常多:导航软件里的语音导航,不管是标准的女声、男声,还是各种明星、网红的特色语音包,都是用 TTS 生成的;听书软件里,把小说、文章、新闻的文本,读给你听,用的也是 TTS 技术;智能音箱、语音助手回复你的话,也是先生成文本,再用 TTS 转换成语音播出来;很多短视频里的旁白、解说,不用真人配音,直接用 AI 生成,用的也是 TTS 技术。
现在的 TTS 技术,已经能生成和真人几乎一模一样的语音了,不仅能模仿不同人的音色、语气、情绪,甚至能模仿方言、外语,还能控制语速、停顿、重音,听起来非常自然,几乎听不出来是机器合成的。
3. 语音唤醒
语音唤醒,就是让设备在待机、休眠的状态下,能听到特定的唤醒词,被唤醒并开始工作,接收后续的语音指令。
比如,你喊 “小爱同学”“嘿 Siri”“小度小度”,对应的手机、智能音箱就会被唤醒,听你接下来的指令,这就是语音唤醒技术。它的特点是,要一直低功耗运行,能在嘈杂的环境里,准确识别出唤醒词,同时不能被其他声音、相似的发音误唤醒,保证准确率和低功耗的平衡。
4. 声纹识别
声纹识别,就像我们熟悉的人脸识别一样。每个人的声音,都有自己独特的发音特征、音色、语调,这些特征就像人的指纹一样,是独一无二的。声纹识别,就是提取语音里的说话人特征,判断这段语音是谁说的,或者验证说话人是不是本人。
声纹识别的应用场景也很多:金融领域,很多银行的 APP,支持声纹登录,你读一段指定的文字,就能验证你的身份,安全登录账号;公安司法领域,用声纹识别来确认嫌疑人的身份,从录音里匹配说话人;会议场景里,会议纪要软件,能通过声纹识别,自动区分不同的说话人,给每段话标上是谁说的;智能家居里,能通过声纹识别,区分家里的不同成员,给不同的人提供个性化的服务。
5. 语音增强与降噪
语音增强与降噪,核心目标是在嘈杂的环境里,把人的语音和背景噪音分离开,把噪音去掉,让人声更清晰、更干净。
比如,我们打电话的时候,哪怕在马路上、在商场里、在地铁上,对方也能听清你说的话,就是因为手机里用了 AI 降噪技术,把背景的车流声、人群声、环境噪音去掉了,只保留了清晰的人声。还有我们录音的时候,能把环境里的空调声、键盘声、风声都去掉,只保留说话人的声音,也是语音增强技术的应用。
语音处理技术,让人和机器的交互变得更简单、更自然。我们不用再打字,只要动动嘴,就能让设备帮我们完成任务:开车的时候,用语音设置导航、接打电话,不用动手,更安全;在家的时候,用语音控制智能家电,开灯、开空调、拉窗帘,动动嘴就能完成。语音交互,已经成为了人和智能设备交互的最重要的方式之一。
四、大语言模型(LLM)——AI 时代的通用智能引擎
大语言模型,英文叫 Large Language Model,简称 LLM,是最近几年 AI 领域最核心、最受关注的技术,也是我们现在接触最多的 AI 技术,ChatGPT、GPT-4、DeepSeek、文心一言这些,都属于大语言模型。
那到底什么是大语言模型?简单来说,大语言模型,就是一个参数规模非常巨大(从几十亿到上万亿个参数)、基于 Transformer 架构、用海量的文本数据训练出来的深度学习模型。
它的核心能力,就是理解和生成人类的自然语言,而且因为它在训练的时候,学习了互联网上几乎所有的公开文本数据,包括书籍、文章、网页、代码、论文、新闻等等,所以它不仅能和人对话,还掌握了海量的知识,具备了强大的推理、逻辑、创作、代码能力。
大语言模型和之前的 NLP 模型,最大的区别是什么?之前的 NLP 模型,大多是 “任务专用” 的,比如一个模型专门做机器翻译,一个模型专门做情感分析,一个模型专门做文本摘要,你要解决不同的 NLP 任务,就要训练不同的模型。
而大语言模型,是 “通用” 的,它不需要针对每个任务单独训练,你只要用自然语言给它下达指令,它就能完成各种各样的任务,不管是写文案、写代码、解数学题、翻译、做分析、写策划,还是和你聊天、给你提建议,它都能完成。
这就是大语言模型最革命性的地方:它让 AI 从 “只能做特定任务的专用工具”,变成了 “能解决各种问题的通用智能引擎”。
大语言模型的能力,主要体现在这么几个方面:
1. 强大的语言理解和生成能力
它能精准理解你说的话、你的指令和需求,哪怕你的表达很口语化、很模糊,它也能 get 到你的核心意思。同时,它能生成通顺、流畅、符合要求、有逻辑的文本,不管是正式的公文、轻松的文案、严谨的技术文档,还是有趣的小说、诗歌,都能写。
而且,它能进行多轮的、连贯的对话,能记住你们之前的聊天内容,理解上下文,不用你每次都把需求重新说一遍。比如,你先让它写一个活动策划,它写完之后,你再跟它说 “把预算部分再细化一下,把活动流程再调整得更具体一点”,它能记住之前写的内容,直接修改对应的部分,不用你再重复一遍背景信息。
2. 海量的知识储备
大语言模型在训练的时候,学习了海量的文本数据,涵盖了科学、历史、文化、技术、生活常识、商业、法律等几乎所有的领域,相当于一个巨大的、随身的百科全书。你有什么不懂的问题,不管是专业的技术问题,还是生活里的常识问题,都可以问它,它能给你清晰的解答
当然,这里也要提醒大家,大语言模型有时候会出现 “幻觉”,也就是它会一本正经地说出一些看起来很合理、但实际上是错误的、凭空捏造的内容。比如,它会编造不存在的历史事件、虚假的论文引用、错误的专业知识。这是因为大语言模型的核心逻辑,是根据学习到的语言规律,生成 “看起来最通顺、最合理” 的文本,而不是严格地输出 “绝对正确的事实”。所以,我们在使用大语言模型的时候,尤其是涉及到专业知识、事实性信息、重要决策的时候,一定要对它给出的内容进行核实和校验,不能盲目轻信。
-
强大的逻辑推理与复杂任务处理能力现在的大语言模型,已经具备了很强的逻辑推理、数学计算、代码编写、多步骤规划的能力。它能解复杂的数学题、物理题,能帮你分析商业案例、制定项目计划,能帮你写代码、找 bug、解释代码逻辑,甚至能帮你完成从需求分析、方案设计、代码编写到测试验证的完整开发流程。更重要的是,它能完成复杂的多步骤任务。比如,你让它帮你策划一场公司的年会,它能从年会主题、时间地点、流程安排、节目策划、物料准备、预算清单、应急预案,给你一套完整的、可落地的方案;你让它帮你做一份行业分析报告,它能从行业现状、市场规模、竞争格局、发展趋势、风险挑战,给你梳理得清清楚楚。
-
工具调用与多模态能力现在的大语言模型,已经不再是只能处理文本的 “聊天机器人” 了。它能调用各种各样的工具,拓展自己的能力边界。比如,它能调用搜索引擎,实时获取最新的信息,解决自己知识储备过时的问题;它能调用计算器、代码解释器,完成精准的数学计算和数据处理;它能调用专业的软件和 API,帮你画图、做 PPT、处理表格、分析数据。同时,大语言模型已经普遍具备了多模态能力,它不仅能处理文本,还能看懂图片、听懂语音、看懂视频。比如,你给它发一张产品设计图,它能帮你分析设计的优缺点,给出优化建议;你给它发一张手写的公式草稿,它能帮你识别公式、讲解解题步骤、纠正错误;你给它发一段视频的内容,它能帮你总结视频的核心内容,提炼关键信息。
正是因为这些强大的能力,大语言模型正在成为 AI 时代的通用基础设施,就像互联网、电力一样,它正在渗透到各行各业、各个岗位,改变我们的工作方式、学习方式和生活方式。不管是程序员、设计师、文案策划、教师、医生、律师,还是企业管理者、创业者,都能借助大语言模型,提升自己的工作效率,拓展自己的能力边界。
五、强化学习 —— 让机器在试错中学会决策,掌握复杂技能强化学习
英文叫 Reinforcement Learning,简称 RL,是机器学习的一个重要分支,它的核心目标,是让机器像人一样,在和环境的互动中,通过 “试错” 的方式,自主学会完成复杂任务、做出最优决策。如果说监督学习(我们前面讲的识别狗的例子)是 “老师教学生,给标准答案”,那强化学习就是 “让学生自己去闯,做对了给奖励,做错了给惩罚,让它自己总结出怎么才能拿到最多的奖励”。
我们用一个非常通俗的例子,来理解强化学习的核心逻辑。比如,我们要教一只小狗学会 “坐下” 这个动作:
- 一开始,小狗完全不知道要做什么,它会随便乱动、乱走、乱叫;
- 当它偶然做出了 “坐下” 的动作,我们立刻给它一块零食作为奖励;
- 如果它做了别的动作,我们就不给奖励,甚至轻微批评一下(惩罚);
- 反复很多次之后,小狗就会明白:只要我做出 “坐下” 的动作,就能拿到零食,得到奖励。于是它就学会了这个技能。
强化学习的核心逻辑,和这个例子几乎一模一样。它有几个核心的组成部分:
- 智能体(Agent):就是我们要训练的 AI 模型,相当于例子里的小狗;
- 环境(Environment):智能体所处的场景,它能感知到的外界信息,相当于小狗所处的房间;
- 动作(Action):智能体可以做出的行为,比如小狗的坐下、站起、走动;
- 奖励(Reward):智能体做出动作之后,得到的正向反馈或者负向反馈,相当于零食奖励或者批评惩罚;
- 策略(Policy):智能体根据当前的环境状态,决定要做出什么动作的一套逻辑,相当于小狗学会的 “坐下就能拿奖励” 的经验。
强化学习的训练过程,就是让智能体在环境里,不断地尝试各种动作,根据得到的奖励或惩罚,不断调整自己的策略,最终学会一套能拿到最多长期奖励的最优决策方法。
很多我们熟悉的 AI 里程碑,背后的核心技术都是强化学习:
- 我们前面提到的 AlphaGo,能战胜围棋世界冠军,核心就是深度学习 + 强化学习。它通过自己和自己下无数盘棋,赢了就得到正向奖励,输了就得到负向奖励,不断优化自己的下棋策略,最终掌握了远超人类的围棋能力;
- 自动驾驶里的决策规划系统,很多也用到了强化学习。AI 在模拟的交通环境里,不断尝试各种驾驶决策,安全到达目的地就给奖励,发生碰撞、违规就给惩罚,最终学会在复杂的路况里做出安全、高效的驾驶决策;
- 机器人控制,比如让机械臂学会精准地抓取物体、让双足机器人学会走路、跑跳、翻越障碍,都是强化学习的重要应用场景;
- 游戏 AI,比如 OpenAI 的 Dota2 AI、腾讯的王者荣耀 AI,能战胜职业电竞选手,背后的核心也是强化学习。AI 在游戏里不断试错,学会了团队配合、战术规划、操作细节,最终达到了顶尖玩家的水平;
- 还有工业优化、资源调度、金融交易、推荐系统等很多领域,都能看到强化学习的应用。比如,用强化学习优化工厂的生产流程,降低能耗、提升效率;用强化学习优化数据中心的散热系统,降低电力消耗;用强化学习优化交通信号灯的调度,缓解城市拥堵。
强化学习最强大的地方,在于它不需要大量的标注数据,只需要定义好 “奖励规则”,就能让 AI 在和环境的互动中,自主学习到复杂的技能和决策能力。它让 AI 从 “识别和理解”,走向了 “决策和行动”,是实现通用人工智能非常重要的一块拼图。
六、多模态人工智能 —— 打通感官壁垒
让 AI 像人一样感知世界多模态人工智能,是现在 AI 发展最重要的趋势之一。这里的 “模态”,通俗来说,就是信息的不同类型和载体,比如文本是一种模态,图片是一种模态,语音是一种模态,视频、3D 模型、传感器数据,都是不同的模态。我们人类感知世界,从来都不是只用一种感官的。我们认识一个东西,会用眼睛看它的样子,用耳朵听它的声音,用手摸它的质感,用鼻子闻它的气味,把这些不同感官的信息整合到一起,形成对这个事物的完整认知。而传统的 AI 模型,大多是单模态的:CV 模型只能处理图片,NLP 模型只能处理文本,语音模型只能处理声音,它们之间是互相割裂的,无法打通不同模态的信息。而多模态 AI,就是要解决这个问题,让 AI 能同时处理、理解、融合多种不同模态的信息,打通 “看、听、说、想” 的壁垒,像人一样,形成对世界的完整、立体的认知。
我们现在接触到的很多酷炫的 AI 应用,背后都是多模态 AI 技术:
-
多模态理解:AI 能同时看懂图片、听懂语音、理解文本,把不同模态的信息结合起来,完成复杂的理解任务。比如,你给 AI 发一张旅游的照片,再问它 “这张照片是在哪里拍的?这里有什么好玩的景点?有什么特色美食?”,AI 能先看懂照片里的风景、建筑特征,结合自己的知识,给你准确的回答;你给 AI 发一张产品的设计图,再用语音给它提修改需求,它能同时看懂图纸、听懂你的语音指令,给出对应的修改方案。还有我们熟悉的自动驾驶,就是典型的多模态融合场景。AI 要同时处理摄像头的图像数据、激光雷达的点云数据、毫米波雷达的测距数据、高精度地图的信息,把这些不同模态的数据融合在一起,才能精准地感知周围的环境,做出安全的驾驶决策。
-
跨模态生成:这是现在最火的 AI 应用方向之一,就是让 AI 用一种模态的信息,生成另一种模态的内容。
- 文生图:你用文字描述你想要的画面,AI 就能生成对应的图片,比如 Midjourney、Stable Diffusion、DALL・E,核心就是多模态生成技术;
- 文生视频:你用文字描述一个视频的内容、场景、镜头,AI 就能生成对应的视频,比如 Sora、Pika,都是基于多模态技术的视频生成模型;
- 文生 3D:你用文字描述一个 3D 模型的样子,AI 就能生成对应的 3D 模型,应用在游戏、动画、工业设计、元宇宙等领域;
- 语音生成视频:你录一段自己说话的语音,AI 就能生成一个数字人,口型、表情和你的语音完全匹配,就像真人在说话一样;
- 还有图生文、图生视频、视频生文案等等,都是跨模态生成的应用。
多模态 AI,彻底打破了不同信息类型之间的壁垒,让 AI 的感知能力、理解能力、创造能力,都实现了质的飞跃。它让 AI 从 “只能处理单一信息的工具”,变成了能像人一样,用多种感官感知世界、理解世界、创造内容的智能体,也是未来通用人工智能发展的核心方向之一。
七、AI 的其他核心技术分支
除了上面这些核心领域,人工智能还有很多重要的技术分支,它们在我们的生活里也无处不在,我们简单给大家介绍几个最常见的:
-
推荐系统:推荐系统,是我们每天接触最多的 AI 技术之一,它的核心目标,是根据用户的行为、偏好、特征,从海量的内容里,给用户推荐他最可能感兴趣、最需要的东西。我们刷短视频的时候,平台给你推的视频;逛电商平台的时候,首页给你推荐的商品;听音乐的时候,APP 给你推荐的歌单;看新闻的时候,给你推送的资讯,背后的核心都是推荐系统。推荐系统就像一个非常懂你的私人助理,它知道你喜欢看什么内容、喜欢买什么东西、喜欢听什么歌,能在海量的信息里,精准地找到你感兴趣的内容,帮你节省筛选信息的时间。现在,推荐系统已经成为了互联网产品的核心竞争力之一,直接影响着用户的使用时长、留存率和平台的商业收益。
-
知识图谱:知识图谱,通俗来说,就是让 AI 把零散的知识,整理成一张结构化的、有逻辑的 “知识大网”。它把现实世界里的实体(比如人、物、地点、事件、概念)作为 “节点”,把实体之间的关系作为 “边”,形成一张巨大的、相互关联的知识网络。举个例子,知识图谱里,“周杰伦” 是一个节点,“叶惠美” 是一个节点,它们之间的边,就是 “母子关系”;“周杰伦” 和 “青花瓷” 之间的边,是 “演唱者” 和 “歌曲” 的关系;“青花瓷” 和 “方文山” 之间的边,是 “作词” 的关系。有了知识图谱,AI 就能更精准地理解知识、理解用户的需求,实现更智能的问答、搜索、推荐。比如,你问智能助手 “周杰伦的妈妈写过什么歌?”,AI 能通过知识图谱,先找到周杰伦和叶惠美的母子关系,再找到叶惠美相关的歌曲作品,给你准确的答案,而不是只搜索包含 “周杰伦的妈妈” 这几个关键词的内容。知识图谱在智能搜索、智能问答、金融风控、医疗知识服务、工业制造等很多领域,都有非常重要的应用。它能让 AI 的知识更结构化、更准确,减少 “幻觉”,是实现可解释 AI 的重要基础。
-
数字人技术:数字人,就是用 AI 技术生成的、拥有和真人相似的外观、动作、表情、语言能力的虚拟人物。我们现在看到的虚拟主播、虚拟偶像、智能客服数字人、短视频里的 AI 数字人,都属于数字人技术的应用。数字人技术,是多个 AI 技术分支的融合:用计算机视觉、图形学技术生成数字人的外观和形象;用语音合成(TTS)技术让数字人开口说话;用表情驱动、动作捕捉技术,让数字人的口型、表情、动作和语音匹配,看起来更自然;用大语言模型,让数字人能和人进行智能对话,理解用户的问题,给出合适的回复。现在,数字人已经有了非常广泛的应用:电商直播里,数字人可以 24 小时不间断直播带货;新闻媒体里,数字人主播可以 24 小时播报新闻;企业里,数字人可以做智能客服、品牌代言人;短视频创作里,普通人用数字人就能生成口播视频,不用自己出镜;还有虚拟偶像、虚拟老师、虚拟医生等等,数字人的应用场景正在越来越广。
第五章 AI 带来的时代变革 —— 它如何改变我们的工作、生活与社会
从蒸汽机带来的工业革命,到电力带来的第二次工业革命,再到计算机、互联网带来的信息革命,人类社会的每一次跨越式发展,都离不开通用技术的革命性突破。而今天的人工智能,正是这样一种能改变整个社会的通用技术,它正在像电力、互联网一样,渗透到我们生活、工作、生产的每一个角落,重塑各行各业的规则,改变我们每个人的生活方式和工作方式,推动整个社会进入一个全新的智能时代。
这一章,我们就给大家讲清楚,AI 到底正在给我们的世界带来什么样的改变,它会如何重塑各行各业,我们每个人的工作和生活会受到什么样的影响,大家最关心的 “AI 会不会取代我的工作” 这个问题,也会在这里给大家讲明白。
一、AI 正在重塑各行各业,带来生产力的革命性提升
人工智能不是只改变某一个行业,而是会给几乎所有的行业,都带来颠覆性的变革和生产力的巨大提升。就像当年的互联网,没有任何一个行业能完全脱离互联网而存在;未来,也不会有任何一个行业,能完全脱离 AI 而存在。我们给大家梳理几个核心行业的变化,看看 AI 是如何在这些行业里落地、创造价值的。
制造业:从自动化到智能化,实现智能制造
制造业是实体经济的核心,而 AI 正在推动制造业,从过去的自动化,走向全面的智能化。在生产环节,AI 能实现智能质检。
过去,工厂里的产品质检,大多靠工人用肉眼检查,不仅效率低、成本高,而且很容易出现漏检、错检,尤其是一些精密的零件,肉眼很难发现微小的瑕疵。
而用基于计算机视觉的 AI 质检系统,能一秒钟检查几十个产品,识别出肉眼根本看不到的微小缺陷,准确率能达到 99% 以上,不仅大幅提升了质检效率和准确率,还能节省大量的人工成本。在生产流程优化上,AI 能通过分析生产线上的各种传感器数据,优化生产参数,提升生产效率,降低原材料消耗和能耗。
比如,在钢铁、化工这类流程型制造业里,生产过程中的温度、压力、原料配比等参数,对产品质量和能耗影响非常大。AI 能通过学习海量的历史生产数据,找到最优的参数组合,自动调整生产流程,既能提升产品的良品率,又能降低能耗和原材料浪费。
还有设备的预测性维护,过去,工厂里的机器设备,要么是坏了再修,会导致生产线停工,造成巨大的损失;要么是定期维护,不管设备有没有问题,都按时拆检保养,会造成不必要的维护成本和停机时间。而 AI 能通过设备上的传感器,实时采集设备的运行数据、振动、温度、噪音等信息,提前预判设备可能出现的故障,在设备还没坏的时候,就提醒维护人员提前检修,避免生产线意外停工,大幅降低设备维护成本和停机损失。除此之外,AI 在供应链优化、生产计划排程、工业机器人控制、仓储物流自动化等方面,都有非常重要的应用,正在推动整个制造业,从 “中国制造” 走向 “中国智造”。
医疗健康行业:提升诊疗效率,普惠优质医疗资源
医疗健康是和每个人都息息相关的行业,而 AI 正在这个行业里,带来巨大的改变,它既能提升医生的诊疗效率和准确率,又能让优质的医疗资源,覆盖到更多偏远地区、基层医院,让更多人享受到更好的医疗服务。
在医学影像诊断领域,AI 已经展现出了非常强大的能力。比如,在肺部 CT 影像里,AI 能精准地识别出早期的肺结节,哪怕是几毫米的微小病灶,也能准确找到,而且能判断结节的良恶性风险,给医生提供参考。在眼底照片、病理切片、乳腺钼靶、核磁影像等很多医学影像的诊断上,AI 都能达到甚至超过资深医生的水平。
它能帮助基层医院的医生,减少漏诊和误诊,让患者在基层就能得到准确的诊断,不用再跑到大城市的大医院排队检查。在辅助诊疗上,AI 能通过学习海量的医学指南、临床病历、医学文献,给医生提供诊断建议、治疗方案推荐、用药提醒。比如,医生输入患者的症状、检查结果、病史,AI 就能给出对应的鉴别诊断建议、治疗方案,提醒医生有没有用药禁忌、药物相互作用,帮助医生,尤其是基层医生,提升诊疗的规范性和准确性,减少医疗差错。在药物研发领域,AI 正在大幅缩短新药研发的周期,降低研发成本。
过去,一款新药的研发,平均需要 10 年以上的时间,花费几十亿美元,而且失败率非常高。而 AI 能在药物靶点发现、化合物分子设计、临床试验设计、临床试验数据分析等各个环节,大幅提升效率。比如,用 AI 设计候选药物分子,原本需要几个月的时间,现在几天就能完成,而且能筛选出效果更好、副作用更小的分子。AI 的出现,让新药研发的成本和周期都大幅降低,也让更多罕见病、疑难病的药物研发,成为了可能。除此之外,AI 在健康管理、慢病管理、康复护理、基因测序分析、医疗机器人等很多领域,都有非常广阔的应用前景。它正在成为医生的得力助手,让医疗服务更高效、更精准、更普惠。
金融行业:提升效率,管控风险,优化服务
金融行业是数据密集型的行业,天生就非常适合 AI 的应用,现在,AI 已经渗透到了银行、证券、保险等金融行业的各个环节,改变着金融行业的服务模式和风控体系。在风险控制领域,AI 是金融机构最重要的风控工具。比如,银行的信贷审批,过去需要信贷员人工审核用户的资料、评估还款能力和违约风险,不仅效率低,而且很难精准把控风险。
而 AI 风控模型,能通过分析用户的征信数据、交易数据、行为数据等多维度的信息,快速、精准地评估用户的信用风险和还款能力,自动完成信贷审批,不仅能把审批时间从几天缩短到几分钟,还能大幅降低坏账率。在反欺诈领域,AI 能实时识别交易中的异常行为,比如盗刷、电信诈骗、洗钱等风险,实时拦截可疑交易,保护用户的资金安全。在智能客服与营销领域,几乎所有的银行、保险公司、证券公司,都有自己的智能客服。
基于大语言模型的智能客服,能精准理解用户的问题,解决账户查询、业务办理、信息咨询等绝大多数的常见问题,不仅能 7×24 小时不间断服务,还能大幅降低人工客服的压力,节省服务成本。同时,AI 能通过分析用户的资产情况、风险偏好、投资习惯、生命周期,给用户推荐适合的金融产品和服务,实现精准的个性化营销,提升金融机构的服务效率和商业收益。在投资交易领域,AI 也有非常广泛的应用。量化投资机构用 AI 模型,分析海量的市场数据、新闻资讯、宏观经济数据,挖掘市场规律,制定交易策略,实现自动化的交易决策。
券商的研究部门,用 AI 快速分析上市公司的财报、行业数据、政策信息,生成研究报告,提升投研效率。保险公司用 AI 优化保险产品的定价、核保、理赔流程,比如,车险的智能理赔,用户拍一张事故现场的照片,AI 就能自动定损、核算理赔金额,几分钟就能完成理赔,不用再等理赔员到现场,大幅提升了理赔效率和用户体验。
教育行业:实现个性化教学,让因材施教成为可能
教育是改变人生命运的重要途径,而 AI 正在给教育行业带来革命性的改变,它能打破传统 “一刀切” 的教学模式,真正实现因材施教,让每个学生都能得到适合自己的教学服务。
在个性化学习上,AI 能根据每个学生的学习情况、知识掌握程度、学习习惯,定制专属的学习路径和学习内容。比如,AI 学习系统,能通过学生的做题情况,精准地判断出他哪些知识点掌握了,哪些知识点还没学会,哪些是易错点、薄弱点,然后针对性地给学生推送对应的讲解视频、练习题,哪里不会就学哪里,不用再和全班同学一起,按同样的进度、学同样的内容。这既能让学习好的学生不用重复学已经会的内容,提升学习效率;也能让基础薄弱的学生,能跟上节奏,把基础打扎实,避免越落越远。
在智能辅导上,AI 能成为每个学生的 “专属私教”。过去,学生遇到不会的题,要么等上课问老师,要么请家教,成本很高,而且不是随时都能问。现在,基于大语言模型的 AI,能随时给学生讲解题目,不仅告诉你答案,还会给你讲清楚解题思路、涉及的知识点、易错点,甚至能举一反三,给你出类似的题目,帮你巩固知识点。不管是语文、数学、英语,还是物理、化学、生物,不管是小学、中学,还是大学的内容,AI 都能给学生提供及时的辅导。
在教学效率提升上,AI 能成为老师的得力助手,把老师从繁琐的重复性工作里解放出来,让老师能把更多的时间和精力,放在和学生的沟通、育人上。比如,AI 能自动批改作业、批改试卷,客观题能直接判分,主观题也能给出批改意见和评分,不用老师再一道题一道题地改;AI 能帮老师备课,生成教案、课件、练习题、试卷;AI 能帮老师分析全班学生的学习情况,哪些知识点是全班的薄弱点,哪些学生需要重点关注,给老师的教学提供参考。
除此之外,AI 在语言学习、职业教育、特殊教育等领域,也有非常多的应用。比如,AI 能帮用户练习英语口语,实时纠正发音、语法问题;能给特殊儿童提供定制化的康复训练和教育方案。AI 正在让优质的教育资源,变得更普惠,让每个学生都能得到更适合自己的教育。
传媒、内容创作与创意行业:降低创作门槛,释放创意潜力
过去,内容创作是有很高的门槛的,写文案、做设计、拍视频、做动画、写代码,都需要专业的技能和多年的经验积累。而 AI 的出现,彻底打破了这些创作的门槛,让普通人也能轻松完成专业级的内容创作,同时也能让专业的创作者,大幅提升创作效率,把更多的精力放在创意本身,而不是繁琐的执行环节。
在文字创作领域,不管是写文案、写新闻稿、写公众号文章、写剧本、写小说、写诗歌,还是写邮件、写报告、写 PPT 大纲、写演讲稿,AI 都能快速完成。
你只要告诉 AI 你的需求、主题、风格、受众,它就能快速生成对应的内容,你只需要做修改和优化就行。哪怕你完全没有文案写作的经验,也能写出通顺、专业、符合要求的文案。对于专业的创作者来说,AI 能帮他们搜集素材、梳理思路、生成初稿、润色优化,大幅提升写作的效率。在设计领域,AI 正在彻底改变设计行业的工作模式。
过去,设计师做一张海报、一个 LOGO、一套 UI 设计,需要花几个小时甚至几天的时间,从找素材、画草图,到反复修改调整。现在,用 AI 绘画工具,你只要用文字描述你想要的设计风格、元素、构图,AI 就能在几秒钟内,生成几十张不同的设计方案,设计师可以直接在这些方案的基础上修改优化,原本需要几天的工作,现在几个小时就能完成。除了平面设计,AI 在工业设计、室内设计、建筑设计、服装设计等领域,也都有非常广泛的应用,能帮设计师快速生成方案、拓展创意灵感,大幅提升设计效率。
在视频和动画创作领域,AI 也带来了颠覆性的改变。过去,做一条短视频,需要写脚本、拍摄、剪辑、配音、加字幕,哪怕是一条几分钟的短视频,也需要花很长的时间。现在,AI 能帮你完成整个流程:用 AI 写脚本、用 AI 生成视频画面、用 AI 做配音、用 AI 自动剪辑、用 AI 自动加字幕,一个人就能快速完成一条专业级的短视频。哪怕是复杂的 3D 动画、特效制作,AI 也能大幅降低制作门槛,提升制作效率,原本需要一个团队花几个月做的动画,现在几个人用几周就能完成。还有很多创意领域,AI 都在带来改变:音乐创作,AI 能帮你写旋律、编曲、做伴奏,哪怕你不懂乐理,也能做出自己的歌;游戏开发,AI 能帮你生成游戏场景、角色模型、剧情、代码,大幅降低游戏开发的门槛和成本;代码开发,AI 能帮你写代码、找 bug、解释代码、重构代码,提升程序员的开发效率。
AI 的出现,不是要取代创意,而是把创作者从繁琐的、重复性的执行工作里解放出来,让他们能把更多的时间和精力,放在创意、构思、审美这些核心的、更有价值的事情上,释放更多的创意潜力。同时,它也让更多没有专业技能的普通人,也能参与到创作中来,实现自己的创意想法。
除了这些行业,AI 在农业、交通、物流、零售、法律、政务、能源、环保等几乎所有的行业,都在带来深刻的变革和效率的提升。比如,农业里,AI 能实现智能播种、智能灌溉、病虫害识别、产量预测,推动智慧农业的发展,让农业生产更高效、更环保;交通领域,AI 推动自动驾驶的发展,优化交通调度,缓解城市拥堵,让出行更安全、更高效;物流领域,AI 优化仓储管理、路径规划、分拣配送,让物流更高效、成本更低。可以说,AI 正在成为推动各行各业升级的核心驱动力,它带来的,不是某一个环节的效率提升,而是整个行业的生产模式、商业模式的重构。
二、AI 对个人的影响:我们的工作会被 AI 取代吗?
这是几乎所有人都最关心的问题:AI 越来越强大,能写文案、能做设计、能写代码、能做数据分析,甚至能看病、能做法律分析,那我们的工作会不会被 AI 取代?我们未来会不会失业?
首先,我们要先明确一个结论:AI 不会完全取代人类的工作,但它会彻底改变几乎所有的工作,会取代很多重复性的、标准化的工作任务,同时也会创造出很多新的工作岗位。未来,不会被 AI 取代的,是会用 AI 的人;而那些只会做重复性工作、不会用 AI 的人,会面临越来越大的竞争压力。
我们可以从三个方面,把这个问题讲清楚:
AI 到底会取代什么样的工作?AI 最擅长、最容易取代的,是那些重复性高、标准化强、有明确规则、不需要太多创意和复杂决策、只需要处理信息和执行固定流程的工作任务,甚至是整个岗位。比如:
- 数据录入、单据审核、基础的会计记账、简单的客服问答、电话销售、基础的文案排版、简单的视频剪辑、标准化的质检工作、基础的代码编写、简单的翻译工作等等。这些工作的核心,都是按照固定的规则,处理标准化的信息,做重复性的操作,而这些,恰恰是 AI 最擅长的,它能比人做得更快、成本更低、出错更少。
- 这里要注意,AI 取代的,首先是 “工作任务”,而不是整个 “岗位”。比如,一个文案策划的岗位,AI 能取代 “写初稿、找素材、简单润色” 这些重复性的任务,但创意构思、品牌策略、客户沟通、内容的最终把控,这些需要对品牌有深刻理解、需要创意、需要和人沟通的工作,AI 很难完全取代。再比如,程序员的岗位,AI 能取代 “写简单的功能代码、找常见的 bug、写注释、做简单的测试” 这些任务,但需求分析、系统架构设计、复杂的业务逻辑拆解、技术方案选型,这些需要深度思考、复杂决策、经验积累的工作,AI 很难完全取代。
AI 很难取代什么样的工作和能力?虽然 AI 的能力越来越强,但有很多人类独有的能力,是 AI 很难替代的,而需要这些能力的工作和岗位,就很难被 AI 完全取代。这些核心能力,主要包括这几类:
- 深度的创意与创新能力:AI 能生成内容、生成方案,但它的生成,本质上是基于学习过的海量数据,进行的组合、模仿和优化,它很难产生真正颠覆性的、突破性的创意和创新。比如,全新的科学理论的提出、颠覆性的技术发明、全新的艺术流派的创造、深刻的文学作品的创作、品牌的核心创意策略,这些需要深度的思考、独特的洞察、颠覆性的创新的工作,核心还是要靠人。
- 复杂的决策与战略判断能力:AI 能给你提供信息、分析利弊、给出建议,但最终的决策,尤其是那些涉及到模糊的、不确定的、多维度权衡的、有重大影响的决策,还是要靠人。比如,企业的战略选择、投资决策、危机处理、复杂的商业谈判,这些决策不仅需要数据和信息,还需要对人性、行业、社会、政策的深刻理解,需要风险判断和取舍的智慧,这些是 AI 很难替代的。
- 人际沟通、情感连接与共情能力:人是社会性的动物,很多工作的核心,是人和人之间的沟通、情感连接、信任建立。比如,心理咨询师,核心是共情、倾听、情感支持,而不是简单的给建议;优秀的销售,核心是理解客户的需求、建立信任、维护客情关系,而不是简单的介绍产品;教师的核心,除了传授知识,还有育人、和学生的情感沟通、价值观的引导;医生的核心,除了诊断治病,还有对患者的人文关怀、情绪安抚。这些需要情感、共情、信任、人际沟通的工作,是 AI 很难替代的。
- 复杂的动手操作与现场应变能力:很多需要在真实的物理世界里,进行复杂的动手操作、应对各种突发的、不确定的现场情况的工作,AI 也很难替代。比如,高级的技工、维修工程师、外科医生、消防员、应急救援人员,他们的工作,不仅需要专业知识,还需要丰富的现场经验、灵活的应变能力、精细的动手操作能力,这些是 AI 和机器人,短期内很难完全替代的。
- 伦理判断与价值选择能力:AI 能处理信息、给出方案,但它没有自己的价值观,也无法进行伦理判断和道德取舍。比如,法律工作里,不仅是法条的适用,还有对公平正义的理解、对案件背后的人情事理的考量;教育工作里,不仅是知识的传授,还有价值观的引导、品德的培养;新闻工作里,不仅是信息的传递,还有对事实的核查、对社会责任的担当。这些涉及到伦理、道德、价值判断的工作,核心必须由人来把控。
- AI 会创造哪些新的工作机会?历史已经无数次证明,技术的革命,从来都不是让工作岗位消失,而是让旧的岗位被淘汰,同时创造出大量新的岗位。工业革命的时候,很多手工业者的岗位消失了,但也创造了工厂里的大量新岗位;互联网革命的时候,很多传统的岗位消失了,但也创造了程序员、产品经理、运营、新媒体、电商等无数的新岗位。AI 革命也是一样,它会淘汰很多旧的工作,也一定会创造出大量我们现在甚至都想象不到的新工作岗位。
现在,我们已经能看到很多由 AI 带来的新的工作机会,比如:
- AI 相关的技术岗位:AI 训练师、大模型算法工程师、提示词工程师、AI 产品经理、AI 应用开发工程师、多模态模型研发工程师、AI 安全工程师等等。随着 AI 的发展,这些和 AI 技术相关的岗位,需求会越来越大。
- AI 应用与优化岗位:各个行业里,负责把 AI 技术落地到具体业务场景里的岗位。比如,制造业的 AI 工艺优化工程师、医疗行业的 AI 医学影像标注师、金融行业的 AI 风控模型优化师、教育行业的 AI 教学内容设计师、广告行业的 AI 创意优化师等等。这些岗位,需要既懂行业业务,又懂 AI 的能力和边界,能把 AI 用在具体的业务里,创造价值。
- AI 内容创作与运营岗位:比如,AI 绘画师、AI 视频创作者、AI 数字人运营师、AI 内容策划师、AI 提示词设计师等等。这些岗位,核心是用好 AI 工具,完成内容创作、品牌运营、商业变现等工作,未来的需求会越来越大。
- AI 相关的服务与监管岗位:比如,AI 伦理顾问、AI 合规专家、AI 安全审计师、AI 法律咨询专家、AI 培训师等等。随着 AI 的普及,关于 AI 的合规、伦理、安全、监管、培训的需求,会越来越多,也会创造出大量的相关岗位。
更重要的是,AI 会成为每个人的 “能力放大器”,它能帮你提升工作效率,拓展你的能力边界。一个会用 AI 的文案,能一个人完成过去一个团队的工作量;一个会用 AI 的设计师,能大幅提升自己的产出效率,接更多的项目;一个会用 AI 的创业者,能用很少的人,完成过去需要一个团队才能完成的工作,实现自己的商业想法。
所以,面对 AI,我们完全不用过度焦虑和恐慌,觉得自己马上就要被 AI 取代了。但我们也绝对不能掉以轻心,觉得 AI 和自己没关系。我们要做的,是主动拥抱 AI,学会使用 AI 这个工具,把它变成自己的能力放大器,提升自己的核心竞争力,从 “被 AI 替代的人”,变成 “用好 AI 的人”。
三、AI 带来的社会变革与机遇
AI 带来的改变,不止于行业和个人,它正在给整个社会,带来深刻的、全方位的变革,也给我们的国家、社会和每个人,带来了前所未有的发展机遇。
首先,AI 正在成为新一轮全球科技竞争的核心赛道,是国家之间科技实力和综合国力竞争的关键。谁能在 AI 技术上占据领先地位,谁就能在未来的全球竞争中,掌握主动权。现在,全球的主要国家,都把人工智能提升到了国家战略的高度,纷纷出台政策、投入巨资,推动 AI 技术的研发和产业落地。我们国家也把人工智能作为新质生产力的核心组成部分,大力推动 AI 技术的自主创新和产业应用,这给国内的 AI 企业、科研机构、从业者,都带来了巨大的发展机遇。
其次,AI 正在推动社会生产力的巨大提升,有望解决很多人类社会面临的重大难题。比如,在气候变化领域,AI 能优化能源结构、提升能源利用效率、预测极端天气、助力碳中和目标的实现;在粮食安全领域,AI 能推动智慧农业发展,提升粮食产量,减少病虫害;在公共卫生领域,AI 能助力疫情防控、新药研发、疾病早筛,提升整个社会的公共卫生水平;在环境保护领域,AI 能监测污染、保护生物多样性、推动生态治理。AI 的发展,能让我们更好地应对这些全球性的挑战,让人类社会实现更可持续的发展。
同时,AI 能让优质的公共服务变得更普惠,缩小不同地区、不同人群之间的差距。比如,优质的医疗资源、教育资源,过去大多集中在大城市、发达地区,偏远地区、基层的人们,很难享受到。而 AI 的出现,能让基层医院用上和大医院一样的 AI 医学影像诊断系统,让偏远地区的学生,能通过 AI 得到个性化的辅导,让优质的资源,通过 AI 的方式,覆盖到更多的人,提升整个社会的公共服务水平,促进社会公平。
当然,AI 的快速发展,也给我们的社会带来了很多新的挑战,比如就业结构的调整、个人隐私的保护、数据安全的问题、AI 的偏见与公平性问题、AI 生成内容的版权问题、AI 的伦理风险、甚至是滥用 AI 带来的安全风险。这些问题,都需要政府、企业、科研机构和我们每个人,一起去面对和解决,通过完善的法律法规、行业规范、技术手段,引导 AI 朝着安全、可控、普惠、向善的方向发展。
第六章 人工智能的未来、挑战与我们的应对
从两千多年前偃师献技的古老想象,到今天大模型时代的爆发,人工智能已经走过了漫长的发展历程,也给我们的世界带来了巨大的改变。但其实,直到今天,我们依然处于人工智能发展的非常早期的阶段,AI 的能力还有巨大的提升空间,它的未来,还有无限的可能性。这一章,我们就和大家聊聊,AI 当前的局限性和面临的挑战,未来的人工智能会朝着什么方向发展,我们普通人,到底该如何面对这个正在被 AI 快速改变的时代,如何在 AI 时代,抓住机遇,不被淘汰。
一、当前的 AI,还有哪些局限性和风险?
虽然现在的 AI 看起来已经非常强大了,能写、能画、能算、能聊,很多方面的能力已经超过了普通人,但我们必须清醒地认识到,我们今天拥有的所有 AI,包括最先进的 GPT-4、Gemini,都还属于弱人工智能(狭义人工智能),它们本质上,都是在特定领域里处理特定任务的工具,还远远没有达到拥有自我意识、自主思考、通用智能的水平。它有很多固有的局限性,也带来了很多新的风险和挑战,我们必须清晰地认识到这些,才能更理性地使用 AI,不盲目乐观,也不盲目恐慌。
当前 AI 的核心局限性
- 幻觉问题:这是大语言模型最普遍、也最需要警惕的问题。我们前面提到过,AI 会一本正经地说出很多看起来很合理、但实际上是完全错误、凭空捏造的内容。它会编造不存在的历史事件、虚假的论文引用、错误的专业知识、不存在的法律法规条文。这是因为,大语言模型的核心逻辑,是根据学习到的语言规律,生成 “最通顺、最符合上下文” 的文本,而不是严格地输出 “绝对正确的事实”。它没有 “知道” 和 “不知道” 的概念,哪怕是它完全不懂的内容,也会强行生成一段看起来很合理的内容。所以,我们在使用 AI 的时候,尤其是涉及到专业知识、事实性信息、重要决策的时候,一定要对它给出的内容进行核实和校验,绝对不能盲目轻信,更不能直接把 AI 生成的内容,不加核实就用在工作、学习、决策里。
- 上下文理解与逻辑推理的局限性:虽然现在的大模型,已经具备了一定的逻辑推理能力,但在面对复杂的、多步骤的逻辑推理、数学计算、长上下文的理解时,还是很容易出现错误。比如,复杂的数学证明、多步骤的业务逻辑推理、几十万字的长文档的深度理解,AI 很容易出现逻辑断层、信息遗漏、推理错误的问题。它的推理,很多时候是基于 “表面的语言关联”,而不是真正的、深度的逻辑思考。
- 缺乏真正的理解和常识:AI 能生成通顺的文本,能回答你的问题,但它并不真正理解自己说的话是什么意思,也没有真正的世界常识。比如,它能告诉你 “水在 100 摄氏度会沸腾”,但它并不真正理解 “沸腾” 是什么,也不知道在高原地区,气压低,水的沸点会低于 100 度,除非它的训练数据里有相关的内容。它没有对物理世界、对现实生活的真实感知和体验,所有的知识,都来自于训练数据里的文本,没有真正的 “理解”。
- 无法处理训练数据之外的、全新的知识:大语言模型的知识,都来自于它训练时使用的数据,它的知识储备有明确的 “截止时间”。比如,一个模型的训练数据截止到 2025 年 1 月,那 2025 年 1 月之后发生的事情、出现的新知识、新的政策法规,它就完全不知道。虽然现在很多模型,能通过调用搜索引擎,获取实时的信息,但这也只是信息的检索和整合,它本身并没有自主学习新知识、更新自己认知的能力。
- 缺乏自主规划和目标感:现在的 AI,都是 “被动执行” 的,你给它一个明确的指令,它能帮你完成,但它不会自己给自己设定目标,不会主动去规划、去完成一个复杂的、长期的任务。比如,你让它帮你写一篇文章,它能写,但它不会主动去思考 “这篇文章要写给谁看,要达到什么目的,要怎么优化才能更好地达到这个目的”,除非你把这些要求,明确地告诉它。它没有自己的目标、欲望、意图,所有的行为,都是对用户指令的响应。
AI 发展带来的风险与挑战除了技术本身的局限性,AI 的快速发展,也给我们带来了很多新的风险和社会挑战,这些问题,已经引起了全球范围内的重视。
- 数据安全与个人隐私风险:AI 的训练和运行,都离不开海量的数据,而这些数据里,很多都包含了个人的隐私信息、企业的商业机密、甚至是国家的敏感数据。如何在 AI 的研发和应用中,保护好个人隐私和数据安全,避免数据泄露、滥用,是一个非常重要的挑战。同时,AI 的深度伪造技术,比如 AI 换脸、AI 合成语音,也可能被用来进行诈骗、造谣、诽谤等违法犯罪行为,给个人的隐私和名誉带来威胁,给社会治理带来新的难题。
- 算法偏见与公平性问题:AI 的能力,来自于训练数据,如果训练数据里,存在偏见、歧视、不公平的内容,那训练出来的 AI 模型,也会带上这些偏见,甚至会放大这些偏见。比如,有的 AI 招聘模型,会对女性候选人有歧视;有的 AI 风控模型,会对特定地区的用户有偏见;有的 AI 司法辅助模型,会对特定人群有不公平的判断。这些算法偏见,会加剧社会的不公平,带来新的歧视,如何保证 AI 的公平性、无偏见性,是 AI 发展中必须解决的重要问题。
- 知识产权与版权问题:现在的 AI 模型,都是用海量的互联网数据、书籍、文章、图片、视频、代码训练出来的,这些数据里,很多都有明确的知识产权,受版权法保护。未经授权,就用这些有版权的内容训练 AI 模型,是否构成侵权?AI 生成的内容,有没有版权?版权归属于谁?是训练它的公司,还是使用它的用户,还是数据的原作者?这些问题,现在全球范围内,都还没有完全统一的法律规定和共识,相关的版权纠纷也越来越多。如何在鼓励 AI 技术创新的同时,保护好原作者的知识产权,是必须解决的法律和伦理问题。
- 就业结构调整带来的社会问题:我们前面讲过,AI 会取代很多重复性的、标准化的工作岗位,虽然它也会创造新的岗位,但这个过程中,必然会有一部分人,因为自己的工作被 AI 取代,面临失业、转行的压力,尤其是那些学历不高、技能单一、从事重复性劳动的人群,会面临更大的冲击。如何帮助这些人群,完成技能转型、再就业,如何应对就业结构的调整带来的社会问题,是政府和整个社会,都需要面对的挑战。
- AI 的伦理与滥用风险:AI 技术是中性的,它能用来做好事,提升效率、造福社会,也能被用来做坏事。比如,用 AI 制作虚假信息、网络谣言,误导公众、扰乱社会秩序;用 AI 制作恶意代码、钓鱼邮件,进行网络攻击、电信诈骗;用 AI 开发自动化的武器,带来军事安全风险;甚至有人会尝试用 AI 突破伦理底线,做危害人类安全的事情。如何建立完善的 AI 伦理规范和监管体系,防止 AI 的滥用,引导 AI 向善发展,是全球各国都需要共同面对的问题。
- 对人类认知和能力的影响:当我们越来越依赖 AI,写文案靠 AI,写代码靠 AI,做方案靠 AI,算题靠 AI,甚至思考问题都先问 AI,长此以往,我们自己的写作能力、思考能力、逻辑推理能力、动手能力,会不会出现退化?当 AI 能给我们所有问题的答案,我们还会不会主动去思考、去探索、去学习?如何在使用 AI 提升效率的同时,保持我们自己的独立思考能力、学习能力和创造力,是我们每个人,都需要思考的问题。
二、人工智能的未来,会朝着什么方向发展?
虽然 AI 还有很多局限性和挑战,但毫无疑问,人工智能的发展,是不可逆转的大趋势,它的能力会越来越强,应用会越来越广,会给我们的世界带来更多的改变。从技术和产业的发展来看,未来的人工智能,会朝着这几个核心的方向发展:
从弱人工智能,向通用人工智能(AGI)迈进
现在我们用的 AI,都是弱人工智能,只能处理特定的任务。而通用人工智能(Artificial General Intelligence,简称 AGI),指的是具备和人类一样的通用智能的 AI,它能理解、学习人类能做的任何智力任务,能适应不同的场景,自主学习新知识、解决新问题,有通用的推理、规划、创造能力。AGI 是很多 AI 研究者的终极目标,也是未来 AI 发展的长期方向。
虽然现在距离真正的 AGI,还有非常远的距离,甚至有很多专家认为,我们永远都造不出真正的 AGI,但毫无疑问,未来的 AI,会越来越朝着 “更通用” 的方向发展。未来的 AI 模型,会具备更强的通用能力,能处理更多不同类型的任务,能更好地理解世界、自主学习、规划决策,而不是只能做特定的事情。
多模态融合能力会越来越强,实现真正的全面感知
未来的 AI,不会再是只能处理文本、只能处理图片的单模态模型,而是会实现全模态的融合。它能像人一样,同时打通视觉、听觉、语言、触觉、甚至嗅觉等所有的感知通道,能同时处理文本、图片、语音、视频、3D 模型、传感器数据等所有类型的信息,把这些信息融合在一起,形成对世界的完整、立体的认知。未来的多模态 AI,不仅能看懂、听懂,还能更精准地理解不同模态信息之间的关联,实现更复杂的跨模态理解和生成。
比如,你给 AI 看一段视频,再给它提一个和视频内容、背景音乐、字幕相关的复杂问题,它能精准地理解并回答;你用语言描述一个产品的功能、外观、使用场景,AI 能直接生成产品的 3D 模型、动画演示、使用说明,甚至是生产工艺的建议。多模态能力的提升,会让 AI 的感知和理解能力,越来越接近人类。
具身智能:让 AI 从虚拟世界走向物理世界,能行动、能交互
现在的 AI,大多都还存在于虚拟世界里,存在于电脑、手机、服务器里,只能处理信息、生成内容,无法和真实的物理世界交互。而具身智能,就是让 AI 拥有一个 “身体”(比如机器人、自动驾驶汽车、无人机),能在真实的物理世界里,感知环境、自主行动、和环境交互、完成复杂的物理任务。具身智能的核心,是让 AI 能像人一样,在和物理世界的互动中,学习和成长,而不是只靠预先训练的数据。
比如,一个具身智能的机器人,能在一个陌生的房间里,自主导航、避开障碍物,找到你让它拿的东西,哪怕它从来没来过这个房间,也没见过这个东西;能像人一样,学会使用各种工具,完成复杂的操作任务,比如做饭、整理房间、维修设备。具身智能,是 AI 从 “信息处理” 走向 “真实世界行动” 的关键一步,也是未来机器人、自动驾驶、智能制造等领域的核心技术。未来,具备具身智能的机器人,会走进工厂、走进家庭,帮我们完成各种体力劳动、操作任务,彻底改变我们的生产和生活方式。
AI 与工具的深度融合,成为能自主完成复杂任务的智能体(Agent)
现在的大语言模型,虽然能力很强,但它能做的事情,还是受限于它本身的能力,比如它无法获取实时的信息,无法完成精准的计算,无法操作专业的软件。而未来的 AI,会和各种各样的工具深度融合,变成能自主规划、自主调用工具、自主完成复杂任务的智能体(AI Agent)。
什么是 AI Agent?简单来说,就是给大模型装上 “手脚” 和 “大脑”,你给它一个目标,它能自己把这个目标拆解成一个个的步骤,自己规划要做什么,需要调用哪些工具(比如搜索引擎、计算器、代码解释器、各种软件和 API),然后一步步执行,遇到问题自己调整优化,最终完成你给的目标。比如,你跟 AI Agent 说 “帮我做一份 2026 年中国新能源汽车行业的分析报告,要包含市场规模、竞争格局、技术趋势、政策环境、投资机会,最后做成 PPT”。它会自己去搜索最新的行业数据、政策文件、企业财报,自己整理分析数据,自己写报告内容,自己生成 PPT,甚至自己找配图、优化排版,最终给你一份完整的、可直接使用的报告和 PPT,全程不需要你干预。AI Agent 的发展,会让 AI 从一个 “你问一句,它答一句” 的工具,变成能帮你完成复杂、长期、多步骤任务的 “智能助理”,能彻底解放我们的生产力。未来,我们每个人,都可能拥有自己专属的 AI Agent,帮我们处理工作、安排生活、学习知识,成为我们和数字世界交互的核心入口。
小模型与端侧 AI 的发展,让 AI 更普惠、更安全、更高效
现在的 AI 热潮,很多都集中在 “大模型” 上,参数越来越多,模型越来越大,需要的算力也越来越多,只能在云端的服务器上运行。但未来,AI 的发展,一定是 “云端大模型” 和 “端侧小模型” 并行发展的。端侧 AI,就是把 AI 模型,部署在我们的手机、电脑、智能汽车、智能家居设备这些终端设备上,直接在本地运行,不用再连接云端的服务器。
端侧 AI 的优势非常明显:首先,响应速度更快,不用再把数据传到云端,再等云端返回结果,能实现实时的响应;其次,能更好地保护隐私和数据安全,因为你的数据都在本地处理,不用传到云端,避免了数据泄露的风险;第三,能降低使用成本,不用依赖云端的算力,也不用支付 API 调用的费用。
未来,会有越来越多的、轻量化的、能力足够强的小模型,能直接在终端设备上运行。我们的手机、电脑、智能设备,都会内置强大的端侧 AI 能力,AI 会变得无处不在,随时可用,而且更安全、更高效。同时,针对不同的行业、不同的场景,会有大量的垂直领域的小模型,它们不需要通用大模型那么大的参数和那么广的知识,但在特定的行业和场景里,效果更好、效率更高、成本更低,能更好地满足行业的落地需求。
AI 的安全、可控、可解释性,会越来越受重视
随着 AI 的能力越来越强,应用越来越广,尤其是在医疗、金融、自动驾驶、司法这些和人的生命、财产、权利息息相关的领域,AI 的安全性、可控性、可解释性,会变得越来越重要。现在的很多大模型,都是 “黑箱模型”,我们只知道它输入了什么,输出了什么,但不知道它内部是怎么思考的,为什么会给出这个结果,无法解释它的决策过程。
这在很多关键领域,是非常大的风险。比如,医疗 AI 给了一个诊断建议,我们需要知道它为什么给出这个建议,依据是什么;自动驾驶的 AI 做出了一个刹车的决策,我们需要知道它为什么做出这个决策,是识别到了什么东西。未来,可解释 AI、AI 安全、AI 对齐(让 AI 的目标和人类的价值观、利益保持一致)的技术,会得到快速的发展。同时,全球各国都会出台更完善的 AI 监管法律法规和行业标准,建立 AI 的风险防控体系,确保 AI 技术的发展,是安全的、可控的、符合人类伦理的、向善的。
三、面对 AI 时代,我们普通人该怎么做?
AI 的浪潮已经到来,它正在改变我们的世界,改变我们的工作和生活。面对这个快速变化的时代,焦虑、恐慌、抵触,都没有用,我们能做的,就是主动拥抱变化,了解 AI、学习 AI、用好 AI,让自己在 AI 时代,能抓住机遇,不被淘汰,甚至实现跨越式的成长。在这里,我们给大家提几个最核心、最实用的建议,不管你是学生,还是职场人,不管你在哪个行业、哪个岗位,都能适用。
放下焦虑,主动拥抱,把 AI 当成工具,而不是敌人
首先,我们要放下对 AI 的焦虑和恐惧。AI 不是来取代人类的,它是人类发明的工具,就像过去的蒸汽机、计算机、互联网一样,它的出现,是为了提升人类的能力,让我们能更高效地做事,解决更多的问题。就像汽车的出现,取代了马车夫,但它也让我们的出行变得更方便,创造了无数新的岗位;互联网的出现,取代了很多传统的岗位,但也创造了更多的新机会。
AI 也是一样,它会淘汰那些只会做重复性工作的人,但会给会用 AI 的人,带来巨大的机会,让你的能力被放大,让你能做到过去做不到的事情。所以,不要害怕 AI,不要抵触 AI,主动去了解它,去尝试使用它,看看它能帮你做什么,能帮你提升哪些工作的效率。哪怕你只是用它来帮你写邮件、做表格、整理资料、学习新知识,它也能给你带来很大的帮助。
学会用好 AI,把它变成自己的 “能力放大器”
未来,人和人之间的差距,很大程度上,不在于你本身的能力有多强,而在于你会不会用 AI,能不能把 AI 的能力,和自己的专业能力、行业经验结合起来,把 AI 变成自己的能力放大器。
同样是文案,一个不会用 AI 的人,写一篇文案要花一天的时间;一个会用 AI 的人,能用 AI 快速生成初稿、找素材、优化润色,两个小时就能完成,而且质量更高,剩下的时间,他可以去做更多的项目,去学习更多的东西,去思考更有创意的内容,差距会越来越大。同样是程序员,一个不会用 AI 的人,写一个功能要花大半天,还要自己慢慢找 bug;一个会用 AI 的人,能用 AI 快速生成代码框架、找 bug、写注释、做测试,效率能提升好几倍,能把更多的时间,放在系统架构设计、技术难点攻克这些更有价值的事情上。
所以,我们要做的,不是和 AI 比谁做得更快、谁记得更多,而是要学会怎么给 AI 提需求、怎么给 AI 指令、怎么优化 AI 生成的内容、怎么把 AI 的结果,变成我们需要的、能解决实际问题的东西。也就是我们常说的 “提示词工程”,更重要的,是你对自己的行业、岗位、业务的深刻理解,知道要让 AI 做什么,怎么判断 AI 生成的内容好不好,怎么优化和调整,最终解决问题。
同时,我们要针对自己的工作和需求,去学习对应的 AI 工具。比如,做文案的,要学好 ChatGPT、Claude 这些大语言模型;做设计的,要学好 Midjourney、Stable Diffusion 这些 AI 绘画工具;做视频的,要学好 AI 视频生成、AI 剪辑工具;做数据的,要学好 AI 数据分析工具。把这些工具用熟、用好,让它们帮你提升效率,解放你的时间和精力。
深耕自己的核心竞争力,提升 AI 很难替代的能力
我们前面讲过,AI 很难替代的,是人类的创意、深度思考、复杂决策、人际沟通、共情能力、行业经验和专业洞察。这些能力,是你的核心竞争力,是你在 AI 时代的立身之本。AI 能帮你写文案,但它无法替代你对品牌、对用户、对市场的深刻理解,无法替代你独特的创意和品牌策略;AI 能帮你写代码,但它无法替代你对业务需求的理解、对系统架构的设计能力、对复杂技术问题的解决能力;AI 能帮你做数据分析,但它无法替代你对业务的洞察,从数据里发现问题、找到机会、给出可落地的商业建议的能力。
所以,我们在学会用好 AI 工具的同时,更要深耕自己的专业领域,积累自己的行业经验、专业知识、业务洞察,提升自己的深度思考能力、创意创新能力、复杂问题解决能力、人际沟通和协作能力。这些,是 AI 很难替代的,也是你最核心的竞争力。不要因为有了 AI,就放弃了学习和思考。恰恰相反,AI 能帮我们处理那些重复性的、低价值的工作,让我们有更多的时间和精力,去学习更核心的知识,去提升自己的核心能力,去做更有价值、更有创造性的事情。
保持终身学习的心态,拥抱变化,持续成长
在 AI 时代,唯一不变的,就是变化。AI 技术的发展速度,快得超乎想象,每天都有新的模型、新的工具、新的应用出现,各行各业的模式,也在因为 AI 而快速变化。过去,我们学一门技能,能吃一辈子;现在,哪怕是很专业的技能,也可能很快就被 AI 改变,甚至被淘汰。
所以,我们必须保持终身学习的心态,不能抱着 “一招鲜,吃遍天” 的想法,要持续学习新的知识、新的技术、新的工具,了解行业的变化和趋势,不断更新自己的认知,提升自己的能力,适应这个快速变化的时代。不要害怕学习新东西,不要觉得 AI 是高科技,自己学不会。现在的 AI 工具,都做得非常简单易用,哪怕你没有任何技术背景,只要会打字、会说话,就能上手使用。
你只要愿意去尝试、去学习,很快就能掌握。同时,我们要保持对新事物的好奇心,关注 AI 的发展趋势,看看 AI 在自己的行业里,有哪些新的应用、新的机会,主动去尝试,抓住新的机遇。很多时候,一个新的技术、新的工具,就能给你带来巨大的机会,让你实现弯道超车。
理性看待 AI,不盲目依赖,保持独立思考和判断能力
最后,也是非常重要的一点:我们要学会用好 AI,但绝对不能盲目依赖 AI,不能放弃自己的独立思考和判断能力。我们前面讲过,AI 有幻觉问题,它会一本正经地说假话,会给出错误的信息、错误的方案;它的逻辑推理能力,也有局限性,很容易出现错误。如果你完全依赖 AI,它说什么你就信什么,它给什么方案你就用什么,不做任何的核实、校验、判断,那很可能会犯严重的错误,给自己带来巨大的损失。
不管是用 AI 写文案、做方案,还是用 AI 解数学题、写代码,甚至是用 AI 查资料、给建议,我们都要保持自己的独立思考和判断。AI 生成的内容,我们要去核实它的事实是否准确,逻辑是否通顺,方案是否可行,有没有错误和漏洞。
我们可以把 AI 当成一个得力的助手,一个能给我们提供参考、帮我们提升效率的工具,但最终的决策、最终的判断、最终的责任,还是要我们自己来承担。同时,我们也要警惕,不要因为有了 AI,就放弃了自己的学习和思考。
比如,学生做题,不能直接抄 AI 的答案,而是要让 AI 给你讲清楚解题思路,自己学会解题的方法;职场人做方案,不能直接用 AI 生成的方案,而是要结合自己对业务的理解,去优化、调整、完善,让方案真正能解决问题。AI 是帮我们提升效率的,不是帮我们偷懒的,如果你用 AI 来偷懒,放弃了自己的学习和成长,那最终,你一定会被 AI 淘汰。
写在最后
从两千多年前,古人对 “人造智能” 的美好想象,到今天,AI 已经走进了我们每个人的生活,成为了我们每天都在使用的工具。人工智能的发展,经历了一次又一次的热潮和寒冬,突破和质疑,才走到了今天。我们正处在一个伟大的变革时代,AI 带来的,是一场堪比工业革命、信息革命的技术革命,它会深刻地改变我们的世界,改变我们每个人的工作、生活和未来。面对这场变革,我们不用盲目乐观,觉得 AI 马上就能实现一切,解决所有问题;也不用盲目悲观,觉得 AI 会取代人类,让我们失业。AI 本质上,是人类智慧的延伸,是我们创造出来的工具。工具本身没有好坏,它能带来什么,取决于我们怎么使用它。对于我们每个人来说,最重要的,就是保持开放的心态,主动拥抱这个变化的时代,了解 AI、学习 AI、用好 AI,不断提升自己的核心竞争力,在这个 AI 时代,抓住机遇,实现自己的价值,和这个伟大的时代一起成长。
更多推荐


所有评论(0)