大模型学习day2
·
一、Transformer 是什么(不用公式,只记你要懂的)
-
Transformer 是现在所有大模型的底层标配架构,没有它就没有现在的千亿大模型。
-
它最核心的亮点:自注意力机制通俗理解:它能像人一样,看懂一句话里前后词语的关联、上下文关系。比如:“他丢了手机,很着急”模型能看懂「他」指谁、「着急」因为丢手机,不是孤立看每个字。
-
记住一句话就行:Transformer = 靠自注意力机制,超强理解上下文,是大模型的地基。
二、为什么以前的 AI 不如 Transformer 大模型
老式架构 CNN、RNN 短板:
- 不能长距离关联上下文
- 只能短句子、不能超长文本、不能写长代码
- 没法支撑海量参数往上堆
Transformer 优势:
- 擅长长文本上下文理解
- 能无限堆参数、堆数据
- 适合做文本、代码、对话、生成类所有任务
三、大模型「参数」到底是什么?通俗解释
- 参数可以理解成:模型的记忆容量 + 思考能力
- 参数越大:
- 懂的知识越多
- 逻辑推理越强
- 写代码、改错、理解需求越准
- 常见档位
- 小参数:几亿 → 只能简单聊天
- 中等:十几亿~几十亿 → 适合做前端代码助手
- 大参数:百亿、千亿 → 通用超强,什么都能干
四、参数是不是越大越好?(必考点)
不是!
- 参数越大,推理越慢、花钱越多
- 小参数模型只要微调好,做前端业务、写代码完全够用
- 我们前端开发:不用追求千亿大模型,中等开源模型就够用
五、上下文窗口 是什么(高频名词)
上下文窗口:大模型一次能记住、能处理的最大文字长度。比如 4K、8K、32K 上下文:
- 4K:大概几千字对话
- 32K:可以读一整篇文档、整份代码文件
做 RAG 知识库、AI 问答,上下文窗口是关键指标。
六、今天必背 5 句核心总结
- 所有现代大模型底层都是 Transformer。
- Transformer 核心是 自注意力机制,擅长理解上下文。
- 参数 = 模型的记忆和推理能力,参数越强越聪明。
- 参数不是越大越好,要兼顾速度、成本、场景。
- 上下文窗口:模型一次能处理和记住的文本长度。
更多推荐



所有评论(0)