边界层 · 技术架构|大模型下一代注意力范式:Qwen、Kimi、DeepSeek 的三条路线
欢迎关注微信公众号“边界层笔记”,一起交流

0. 先说清楚:「边界层」和我是谁?
在流体力学里,「边界层」(boundary layer)是一个很经典的概念。
1904 年,德国科学家 普朗特(Ludwig Prandtl) 提出:当粘性流体(空气、水)流过机翼、船体等固体表面时:
- 紧贴壁面,流体速度被“钉死”为 0(无滑移条件)
- 远离壁面,速度接近稳定的自由流速度U∞
中间这层速度变化非常剧烈、粘性力占主导的薄层,就是边界层。
普朗特做的一件关键事情,是把复杂流场拆成两块来处理:
- 边界层内:用简化的纳维–斯托克斯方程,认真管粘性、摩擦
- 边界层外:近似成“无粘理想流体”,用势流理论、伯努利方程就够了
这种“内外分层”的视角,后来成了现代空气动力学的基础。
我挺喜欢这个隐喻,就把这个公众号叫做 「边界层」:
- 一侧是架构、算子、论文、kernel、benchmark
- 另一侧是产品形态、成本结构、业务场景、组织分工
- 而我们这些 不写核心代码、但又必须理解 AI 的行业人,恰好就活在这条“边界层”上
所以这里的文章,会尽量分成两部分来看问题:
- 边界层内:技术本身到底在改什么
- 边界层外:这对产品、成本、工作方式有什么实际影响
一、为什么大家突然都在「动注意力的刀」?
先声明一下:
我不是算法工程师,也不做内核优化工作。
下面是我作为一个做产品 / 市场 / 策略的人,在梳理公开技术资料后的个人理解与翻译,希望帮不写代码的人,也能看懂最近这波「改注意力」到底在改什么。
过去几年,大模型的故事,大部分围绕三个关键词:
- 更大参数
- 更长上下文
- 更便宜
参数可以继续堆,显卡还能继续买,但真正卡住的是:
- 长上下文下的算力和显存成本(128K、1M token 级别)
- 企业最关心的:这个东西每个月是不是把预算烧穿
而这些问题,几乎都指向同一块:Self-Attention(自注意力)。
标准 Transformer 里的 self-attention,本质是:
所有 token 和所有 token 两两互相算一遍
上下文长度翻 2 倍,计算量和显存占用基本涨到 4 倍(O(n²) 复杂度)。
当你想在一个模型里塞进 1M 个 token 的时候,这种玩法就非常疼。
所以 2024–2025 这两年,很多团队开始认真问一个问题:
能不能在 不推倒 Transformer 整体范式 的前提下,
把注意力这一块,换成更「省钱」的版本?
现在看下来,大致有三条主线:
- 继续用 Full Attention,但做极致的工程优化
- 走 Sparse Attention(稀疏注意力):不是人人都算,而是“只算最值得算的那一部分”
- 走 Linear Attention(线性注意力):直接把注意力公式改写成“对一个状态矩阵的增量更新”,把复杂度做到 O(n)

图 1:Dense Attention(左)需要对所有 token 两两计算注意力;Sparse Attention(右)只保留局部窗口 + 稀疏连接,计算量从 O(n²) 降到近似 O(n)。Linear Attention 可以理解为另一种思路:不再直接算完整注意力矩阵,而是维护一个随序列更新的状态。
而在这三条路线里:Qwen、Kimi、DeepSeek 的选择很有代表性:
- Qwen:在线性注意力上押注,但用 混合架构 稳住效果
- Kimi:更激进地 All-in 线性注意力,把它做成旗舰卖点
- DeepSeek:主线还是 原生稀疏注意力(NSA / DSA),把 sparse 做到极致
下面我们就站在「边界层」上,把这三条路线拆开看看。
二、三个关键词:先把 Full / Sparse / Linear 讲明白
1. 【边界层内】Full Attention:效果强,但成本是硬伤
标准 self-attention 的做法,是所有 token 和所有 token 两两互相关注:
- 好处:
- 任意两个位置都能建立联系,效果强、泛用性好
- 坏处:
- 复杂度 O(n²),上下文一长,显存、时延、费用一起飞
所以 Full Attention 在技术上近乎“默认标准答案”,但在成本上越来越难扛。
【边界层外】对我们意味着什么?
- 做长文档、长对话、Agent 场景时:
- token 越多,账单越可观
- 1M context 如果完全用 Full Attention 做,很容易直接把“长上下文”变成一个只能写在 PPT 上的功能点
- 对大模型平台或云厂商来说:
- 想在 API 价格上卷,就必须在 attention 这里找到新的“省钱方法”
2. Sparse Attention:只算最值得算的那一部分
【边界层内】
Sparse 的思路是:
不是所有 token 都值钱,
我只让一部分 token 互相关注。
典型做法有:
- 滑动窗口(local window):只看附近的一小段
- 加少量 全局 token(global tokens)
- 或者像 DeepSeek 那样,上一个类似「Lightning Indexer」的模块,先粗算一遍哪些 token 值得重点看,再精算那一小撮
本质是:不改变 Transformer 的整体结构,通过“聪明地丢掉一部分连线”来省算力。
【边界层外】
- 对工程体系比较稳的大厂来说,Sparse 有天然优势:
- 不需要完全改算子
- 可以在现有框架(如 vLLM / SGLang 等)里做“稀疏 kernel 优化”
- 对自建推理、私有化部署的团队来说:
-
稀疏注意力是一条很现实的“降本增效路线”:
在不大改基础设施的前提下,把推理成本压一截
-
3. Linear Attention:把注意力变成“写一个记事本”
【边界层内】
Linear Attention 更激进:
与其让每个 token 和所有历史 token 两两算,
不如维护一个「状态矩阵」,
每看到一个新 token,就对这个矩阵做一次增量更新。
于是复杂度从 O(n²) 变成 O(n)。
代表性工作之一是 DeltaNet:用一个经典的 Delta Rule(增量更新规则) 来更新状态矩阵。
直觉上可以这么理解:
-
Full Attention:
每次开会,所有人互相都说一遍,还都记在脑子里
-
Linear Attention / DeltaNet:
办公室墙上有一块「白板」,大家轮流上去写重点,白板本身就是那块“状态记忆”
当然,怎么写、写多少、什么时候擦掉一部分,就是 Qwen / Kimi 这些团队在继续优化的内容。
【边界层外】
- 把 attention 做成 O(n),理论上对 长上下文 + 流式生成 + Agent 这种任务非常友好
- 但这条路有一个现实门槛:
- 需要在 算法、训练配方、kernel、硬件 pipeline 上做一整套适配
- 不再是“在现有 infra 上挂一个小模块”,而是实打实地“重新设计主力注意力模块”
三、路线一:Qwen——Gated DeltaNet 混合架构
1. 【边界层内】Gated DeltaNet 做了什么?

图 2:DeltaNet 采用增量更新的「状态矩阵」来替代显式的 n×n 注意力矩阵,示意了随序列 chunk 迭代更新状态并并行计算输出的过程。
DeltaNet 是一类“用 Delta Rule 更新状态矩阵”的线性 Transformer,在很多 in-context retrieval(上下文检索) 任务上表现不错。
Qwen 在此基础上加了一层 门控(Gated):
每次是否要往记事本上认真写一行、写得轻一点、还是干脆略过——
交给模型自己学。
这个 Gate,本质上是一套「什么时候强记、什么时候弱记、什么时候不记」的策略。
更关键的是 3:1 混合架构:
- 大约 75% 的层用 Gated DeltaNet(线性注意力)
- 25% 的层保留 Full Attention
- 在网络里按 3:1 的比例交替排布 [3]
官方和社区的分析大致结论:
在「训练配方完全一样」的前提下,
这套混合架构在语言建模和下游任务上,都优于纯 Transformer baseline,
同时训练 & 推理成本更低。
这意味着:线性注意力不再只是“凑数的效率模块”,而是已经走进旗舰模型主干结构。
2. 【边界层外】Qwen 路线给我们的信号
从一个做产品 / 战略的视角,我会这样解读 Qwen:
- 不 All-in 线性,是一个偏稳健的决策
-
当前生态(框架、插件、优化经验)基本都是围绕 Full Attention 打造
-
线性注意力要成为“默认主力”,必须先证明:
在相同参数和训练预算下,效果不差甚至更好
-
3:1 混合是一种“风险可控的升级”:兼顾效果与成本
-
- 把线性 attention 从论文实验推向了工业主力
-
当一个 80B 级旗舰模型,在 75% 的层上使用 Gated DeltaNet,这本身就是信号:
未来两年,线性注意力会越来越多地出现在「生产主力模型」里
-
- 对生态伙伴 &大数据从业者意味着什么?
- 之后的蒸馏、多模态扩展、私有化版本,很可能继承这套 attention 设计
- 如果你在做和 Qwen 生态强绑定的应用(包括国产云上的企业方案),
- 这会逐渐变成你默认要跟的“范式”
四、路线二:Kimi——Kimi Linear & KDA,把线性注意力拉满
如果说 Qwen 是“稳扎稳打上了线性注意力”,
那 Kimi Linear 更像是直接喊了一句:
我们押注线性注意力,
它不仅便宜,而且在一堆场景下 效果还更好。
1. 【边界层内】Kimi Linear 的核心设计
根据论文和官方信息,[4]
-
在 公平对比(训练配方一致) 的条件下,
他们宣称在线性 attention 上全面超越 Full Attention:
- 覆盖短上下文、长上下文和 RL scaling
-
相同训练设置下:
- 1M context 下解码吞吐最高可提升到 6×
- KV cache 占用最多可降到原来的 25%
架构上:
- 使用新的线性注意力模块:KDA(Kimi Delta Attention)
- 每 3 层 KDA 插 1 层 MLA(Multi-Head Latent Attention)全局注意力,还是一个 3:1 混合结构

图 3:Kimi Linear 的基本 Block 结构,上:MLA + MoE,全局注意力层;下:KDA(Kimi Delta Attention)+ MoE,作为线性注意力主力层,整体按 3:1 交替堆叠。
和 Qwen 有点“英雄所见略同”,但细节更激进。
相比 Gated DeltaNet,KDA 在几个维度上做了强化:
- 门控粒度更细
- Gated DeltaNet 多是 head 级别的控制
- KDA 把 gate 开到 channel 级,每个特征维度有自己的遗忘率,状态矩阵用得更“抠门但精细”
- DPLR(Diagonal + Low Rank)Transition 的硬件友好实现
- 状态更新矩阵被精心设计为 对角 + 低秩 结构
- 再加上特制的分块算法,方便在 GPU / Tensor Core 上高效跑
- 算法 + kernel 一体化优化
- 不是“写个新 attention 模块就完事”,而是和硬件执行 pipeline 绑在一起优化
- 这也是为什么它能在 1M context 下拿出 6× 吞吐这种比较夸张的数字
2. 【边界层外】Kimi 路线的产品和业务意味
-
技术与产品叙事高度对齐
- 产品定位:长文档 / 知识助手
- 技术路线:押注长上下文友好的线性 attention
- 官方叙事里反复出现的两个点:
- 1M context 下 6× 吞吐
- KV cache 降 75%
对业务方来说,这是非常直接的指标:
你可以在同样的硬件和预算下,做更多事情。
-
试图改写“线性注意力 = 效果差一点”的刻板印象
过去的普遍认知是:
- 线性 attention:省钱、省显存,但效果比 Full 差一点
- 真正的旗舰模型,通常仍以 Full / Sparse 为主
Kimi Linear 给出的新叙事是:
在同等训练配方下,线性 attention 不仅不差,某些任务上反而更好。
这会影响整个行业对线性注意力的心理预期。
-
把线性注意力推进到 Agent 场景
很多解读会强调:
- Kimi Linear 更适合 Agent:
- 上下文极长、状态很多
- KV 压力小、吞吐高
- 再加上线性 attention 天然的“状态追踪”结构优势
换句话说,它在尝试把自己变成:
“下一代 Agent 用的底座,而不是一个便宜点的长上下文模型”
- Kimi Linear 更适合 Agent:
对我们这种做数据 / AI / 应用的人来说:
-
如果你在做 知识库 / 文档问答 / Agent Workflow,
Kimi Linear 是未来两年很值得盯住的一条线路。
五、路线三:DeepSeek——把 NSA / DSA 稀疏注意力做到极致
DeepSeek 的主线和前两家有点不同:
目前公开强调的核心,不是线性 attention,而是自己的 NSA → DSA 稀疏注意力路线。

图 4:DeepSeek Sparse Attention(DSA)的两阶段路径:先由 Lightning Indexer 粗打分,再在被选中的 Top-k token 上做精细注意力,从而在保留长程依赖的同时显著压缩计算量。
1. 【边界层内】NSA / DSA 在做什么?
NSA(Native Sparse Attention) 的思路大致是:
- 一开始就按稀疏结构训练,而不是先 dense 再剪枝
- 结合局部窗口 + 全局 token,对 token 做分层压缩和选择
- 在 kernel / 系统上配合,实现真实吞吐提升
DeepSeek-V3.2 又推出了 DSA(DeepSeek Sparse Attention),[5] 可以理解为 NSA 的进化:
- 加了一个极轻量的 Lightning Indexer:
- 用一个体积很小、FP8 精度的“迷你注意力模块”,给所有历史 token 打“重要性分”
- 虽然理论复杂度仍是 O(n²),但算得很粗、很快
- 主注意力只对被选中的那一小部分 token 做精算
等于把 dense attention 砍成两段:
- 极轻量的“预选阶段”(Lightning Indexer)
- 覆盖少数 token 的精算阶段
2. 【边界层外】DeepSeek 路线的现实考量
-
极致性价比导向
-
DeepSeek V 系列一个最鲜明标签就是“便宜”
-
在这种总体策略下,attention 的自然问题是:
如何在不彻底颠覆现有基础设施的前提下,把成本压到极致?
稀疏注意力是一个非常自然的答案。
-
-
工程与系统视角很重
- 相比重新设计 attention 数学形式,DeepSeek 更像是在问:
- 稀疏模式怎么在 GPU / 集群上“真跑得快”?
- 怎么兼容 vLLM / SGLang 等主流推理框架?
- 这对想在本地或云上自建推理服务的团队很关键
- 相比重新设计 attention 数学形式,DeepSeek 更像是在问:
-
不改算子本身,而是把“算哪些 token”做得极致聪明
-
和 Kimi 的思路不同:
Kimi 改的是“算子 + 状态结构”
DeepSeek 改的是“筛选策略 + 稀疏模式”
-
对实际项目方来说:
-
如果你的 首要目标是 TCO / 自建推理成本,
DeepSeek 这条 NSA / DSA 路线是非常值得算账的一支:
- API 端已经在价格上很激进 [7]
- 自建时,稀疏架构进一步帮助节省显卡和能耗
六、三条路线放在一起:这是一个 Hybrid 时代
如果我们做一个很粗暴的二维坐标:
- 横轴:对现有架构 / 工程体系的侵入程度
- 纵轴:在长上下文 / Agent 场景中的潜在结构优势
可以大致这样定位:
- Qwen:中等侵入 + 中高潜力
- 线性 attention + Full Attention 的 3:1 混合
- 强调“在相同训练配方下效果更好 + 成本更低”
- Kimi Linear:高侵入 + 高潜力
- 直接把 KDA 做成主力注意力
- 在线性 attention 的可表达性与硬件适配上“梭了一步”
- DeepSeek DSA:低算子侵入 + 高工程效率
- 保留 Transformer 主体
- 把“稀疏 + Indexer + 工程优化”做到极致
- 非常适合讲“性价比 / 吞吐”的故事
对我们这些站在「边界层」上的人来说,更重要的问题不是“谁赢谁输”,而是:
在未来二三年,你接触到的大模型,大概率都会是各种 Hybrid Attention 的组合。
真正要看的,是每家在自己选定的 Hybrid 范式上:
- 工程能不能跑顺
- 生态能不能跟上
- 成本和效果能不能同时站得住
七、【边界层外】对大数据 / AI 从业者,应该怎么用这三条路?
给一个非常“落地向”的 checklist:
-
做长文档 / 知识库 / Agent 产品时:
- 优先关注 Kimi Linear 这一类线性 attention 路线
- 看两个指标:
- 在 512K / 1M 上的吞吐和时延
- 上下文成本(token 价格 + KV cache 占用)
-
希望走更稳健的“国产生态主线”:
- Qwen 的混合架构是一个很自然的选项:
- 不放弃 Full Attention 的成熟经验
- 又借线性 attention 把效率和长上下文能力拉上来
- 对接各家国产云(含你之前阿里云同事所在的体系)时,这条线的兼容性和路线透明度会比较好观察
- Qwen 的混合架构是一个很自然的选项:
-
首要 KPI 是“性价比”和“可控的自建推理成本”:
- 尤其是在:
- 数据敏感、必须私有化
- 预算有限但想堆多个模型的场景
- DeepSeek 的 NSA / DSA 路线,是值得用 excel 真正算一遍 TCO 的:
在相同业务指标下,
你要多少卡、多少电、多少机房位、多少 API 费用?
- 尤其是在:
八、写在最后:为什么非工程师也应该盯着注意力?
站在「边界层」这条线上,我会特别关注三点:
-
注意力不再是“论文里的数学公式”,而是进入了产品/商业叙事
- Kimi 讲 Kimi Linear
- DeepSeek 讲 NSA / DSA
- Qwen 讲 Gated DeltaNet 混合结构
这意味着:注意力的形态,已经变成可以对客户讲清楚的差异点。
-
真正的分水岭不是谁赢谁输,而是谁先把自己的 Hybrid 范式跑顺
- 未来的旗舰模型,很可能都不是纯 Full / 纯 Sparse / 纯 Linear
- 而是各种“混合结构 + 工程优化 + 硬件协同”的组合
- 对我们来说,重要的是读懂每家在讲的那套 Hybrid 范式背后,到底在换什么成本、博什么收益
-
对非工程师来说,最重要的两个问题其实很简单:
- 这条注意力路线,能不能显著降低我的总成本(钱 + 时间)?
- 它在 长上下文 / 多轮任务 / Agent 场景 下,能不能拉开体验差距?
如果有一天,大部分人已经不再关心“你用的是 Full、Sparse 还是 Linear”,
就像今天很少有人关心手机 SoC 里哪一级 cache 有多大——
那可能意味着:下一代注意力范式,已经真正沉到底层,变成新的基础设施。
在那之前,我会继续站在这条「边界层」上,
尽量把这些看起来“很底层”的细节,翻译成我们能用得上的:
- 产品判断
- 成本决策
- 以及对整个 AI 行业路线的长期理解。
部分配图引用自:
- DeltaNet: Parallelizing Linear Transformers with the Delta Rule over Sequence Length 及作者博客;
- Kimi Linear: Kimi Linear Tech Report 及相关技术解读文章;
- DeepSeek Sparse Attention: DeepSeek-V3.2-Exp 技术报告与社区解析文章;
- Dense/Sparse 对比:关于长上下文与稀疏注意力的公开技术博客。
✍️ 科里笔记 Coralyx Notes
Written by 科里(Coralyx),发表于「边界层」
如果你也是不写代码、但必须理解 AI 的行业人,欢迎关注这个号,一起在边界层上看世界。
更多推荐


所有评论(0)