前几天和几个朋友吃饭,聊起大模型,发现一个有趣的现象:大家都在用,但一说到"参数"、"上下文"这些词,集体摇头说听不懂。

其实真没那么复杂。这篇文章我想了很久,决定用最通俗的方式给你讲明白——不用记公式,不用懂代码,看完保证你再看那些科技新闻,能跟着点头说"哦,原来是这么回事"。


一、模型参数:厨师的"经验值"

先从最常听到的"模型参数"说起。新闻里说GPT-4有多少亿参数,Claude又升级到多少亿了,听着吓人,其实说白了就是个经验值问题。

上周我去楼下一家开了二十年的川菜馆吃饭,老板亲自下厨。我说我不能吃太辣,但又想要那个香味,老板说行,给你调整一下。菜上来果然刚刚好——既有川菜的香,又不会辣得难受。

换作是刚入行的年轻厨师呢?可能就只会照着菜谱做,你说少放辣,他直接少放两勺,结果味道就不对了。

这就是区别。老师傅脑子里装了几十年的经验,知道什么情况下怎么调整。模型参数,就像是这个厨师脑子里积累的经验值。

参数越多,意味着这个模型"见过"的东西越多。就像那个老师傅,不仅会做菜单上的菜,你说个稀奇古怪的想法,他也能给你整出来。

但参数也不是越大越好。老师傅经验多,但做菜慢啊,你饿得肚子咕咕叫,他还在那儿慢条斯理地调味。新手虽然经验少,但手脚麻利,炒个简单的菜很快就上桌了。

写个简单的工作邮件,用小模型就行,速度快还免费;但如果要写篇深度分析报告,还是得用大模型。


二、上下文长度:你的"短期记忆力"

再来说说"上下文长度"。这个概念特别重要,直接影响你用大模型的体验。

你有没有遇到过这种情况:和大模型聊了一会儿,它突然忘了前面你说过什么?比如你刚告诉它"我是做产品经理的",下一句问"帮我写个简历",它写出来的还是通用模板。

这就是上下文长度不够。

想象一下和朋友聊天。有的朋友记性特别好,你们上个月聊的八卦,他现在还能接上。但有的朋友就不行,你刚说三句话,他已经忘了前两句,你得不停重复,聊得特别累。

上下文长度,就是大模型的短期记忆力——它能记住前面多少对话内容。

上个月我帮一个朋友改论文,5000多字。先用了个普通模型,结果改到第三章就开始乱来了,因为它读不完,记不住第一章写了什么。后来换了个长上下文的模型,一口气读完,改出来的东西连章节之间的逻辑都能理顺。

写小说也是一样。如果你写了十章,想让大模型帮你构思第十一章,它得记住前面的人物关系、剧情伏笔,不然写出来的肯定会前后矛盾。

技术上上下文长度通常用"token"来衡量,1个token大约等于0.7个汉字。所以4K上下文大概能记2800字,128K就能记9万字——差不多能装下一本长篇小说了。


三、思维链:先想再答

"思维链"这个词听起来有点玄乎,其实是个特别实用的技术。

回想一下你上学时做数学题的场景。有的同学拿着题目直接写答案,结果经常算错。有的同学会把思考过程一步步写出来:“第一步,先算这个;第二步,再算那个;所以最后答案是…”

把思考过程写出来,正确率会高很多。

思维链就是让大模型这么做——先把思考过程说出来,再给答案。

比如你问:“张三比李四大3岁,李四比王五大2岁,王五10岁,张三几岁?”

如果直接问,大模型可能随口给你个答案,没准还算错。但如果你让它先思考再回答,它会这么说:

“让我想想。首先,王五10岁;李四比王五大2岁,所以李四是12岁;张三比李四大3岁,所以张三是15岁。对,这样算下来张三应该是15岁。”

你看,这样不仅正确率高,而且你能看到它的思考过程——如果哪里错了,你也能发现问题出在第几步。

现在还有更高级的玩法,比如让大模型写完答案后,自己再检查一遍,或者用另一种方法验证一下。就像学霸做完题会验算一样,大模型也能自我纠错。


四、量化技术:轻装上阵

"量化"这个词听着有点技术含量,其实核心思想特别简单——就是把大模型"压缩"一下,让它变小、跑得更快。

你要去旅行,塞了满满一箱子衣服,拉链拉不上了怎么办?你可以把每一件衣服都叠得更紧,把牙刷、袜子塞在缝隙里,挤一挤,箱子就合上了。虽然衣服会有点皱,但问题不大,重要的是你能把这些东西都带走。

量化技术干的就是这件事。

大模型里的数字通常是"高精度"的,就像买东西时精确到几分钱。但很多时候,我们不需要这么精确,精确到几毛钱就够了。量化就是把这些高精度数字换成低精度的,比如从32位降到8位。

这样一来:

  • 模型体积变小了——原来可能需要100GB,现在只要25GB
  • 运行速度变快了
  • 对硬件要求降低了——原来需要顶配显卡,现在普通电脑也能跑

你肯定会问:压缩了不会影响效果吗?

适度压缩不会。就像你拍照片,原图10MB,压缩成2MB,画质几乎看不出区别。但如果硬要压缩成100KB,那可能就模糊了。

现在主流的8位量化技术,能在保持95%以上效果的同时,让模型变小一半以上。这就是为什么现在很多大模型都能直接在手机上跑了——不用联网,速度还快。


五、模型蒸馏:小学生学大学生

最后来说说"模型蒸馏"。这个名字很形象,一听就能明白个大概。

想象一下有一位大学教授,知识渊博,讲课特别好。但这位教授很忙,请他讲课出场费很贵,而且他讲的内容太深奥,普通学生听不懂。

怎么办呢?教授可以收个聪明的小学生当徒弟,把自己的知识传授给他。这个小学生虽然年纪小,但学了教授的真本事,能给其他普通学生讲课了——收费便宜,讲的内容还通俗易懂。

模型蒸馏就是这么回事:用大模型(老师)来训练小模型(学生),让小模型学得像大模型一样好。

为什么要这么折腾?因为大模型虽然厉害,但缺点也很明显:跑一次要几块钱,回答个问题要等几秒钟,还得用高性能服务器。

而经过蒸馏的小模型就不一样了:跑一次几分钱,毫秒级响应,手机上就能跑。最重要的是,小模型虽然小,但效果可能能达到大模型的80%-90%。

对于很多日常任务来说,这已经完全够用了。

你想想你手机输入法的联想词功能,如果用大模型,你每打一个字它都要联网,还慢;用经过蒸馏的小模型,直接在手机本地运行,速度快,还不用联网,保护隐私。

现在很多APP里的智能客服,用的也是这种小模型——既能回答你的问题,又不会让APP变得卡顿。


总结一下

这五个技术其实是相辅相成的:模型参数是基础,决定了上限;上下文长度让它能记住更多;思维链让它会思考;量化技术让它跑得更快;模型蒸馏让这些技术能真正用到我们的手机和电脑里。

加在一起,就是我们今天看到的各种好用的AI产品的背后秘密。


最后给你几个实用建议

说了这么多,给你几个能马上用到的小技巧:

首先,选模型不一定选最大的,合适最重要。写个简单的工作邮件、发个朋友圈文案,用小模型就够,速度快还免费。但如果要写深度文章、做复杂分析,还是得用大模型。

然后,如果你想让大模型给出更准确的答案,可以在问题最后加一句"请先一步步思考,再给答案"。这么简单一句话,效果往往会好很多。

还有,发长文档给大模型之前,先看看它的上下文长度够不够。如果不够,可以把文档分成几部分,或者换个专门处理长文档的模型。

如果你想在自己的电脑或手机上玩大模型,优先选量化后的版本。它们对硬件要求低,效果也不差。


写在最后

大模型这些技术听起来很高深,其实本质上都是在解决几个很朴素的问题:怎么让AI更聪明、怎么让AI记得更多、怎么让AI思考得更清楚、怎么让AI跑得更快、怎么让AI用起来更便宜。

今天讲的这五个点,就是理解大模型的五把钥匙。希望这篇文章能帮你推开这扇门,看到AI世界里更有意思的东西。

如果你觉得这篇文章对你有帮助,欢迎转发给你的朋友,让更多人能看懂大模型的门道。


你用大模型时遇到过最有意思的事儿是什么?欢迎在评论区分享!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐