欢迎关注微信公众号“边界层笔记”,一起交流

0. 先说清楚:「边界层」和我是谁?

在流体力学里,「边界层」(boundary layer)是一个很经典的概念。

1904 年,德国科学家 普朗特(Ludwig Prandtl) 提出:当粘性流体(空气、水)流过机翼、船体等固体表面时:

  • 紧贴壁面,流体速度被“钉死”为 0(无滑移条件)
  • 远离壁面,速度接近稳定的自由流速度U

中间这层速度变化非常剧烈、粘性力占主导的薄层,就是边界层

普朗特做的一件关键事情,是把复杂流场拆成两块来处理:

  • 边界层内:用简化的纳维–斯托克斯方程,认真管粘性、摩擦
  • 边界层外:近似成“无粘理想流体”,用势流理论、伯努利方程就够了

这种“内外分层”的视角,后来成了现代空气动力学的基础。

我挺喜欢这个隐喻,就把这个公众号叫做 「边界层」

  • 一侧是架构、算子、论文、kernel、benchmark
  • 另一侧是产品形态、成本结构、业务场景、组织分工
  • 而我们这些 不写核心代码、但又必须理解 AI 的行业人,恰好就活在这条“边界层”上

所以这里的文章,会尽量分成两部分来看问题:

  • 边界层内:技术本身到底在改什么
  • 边界层外:这对产品、成本、工作方式有什么实际影响

一、为什么大家突然都在「动注意力的刀」?

先声明一下:

我不是算法工程师,也不做内核优化工作。

下面是我作为一个做产品 / 市场 / 策略的人,在梳理公开技术资料后的个人理解与翻译,希望帮不写代码的人,也能看懂最近这波「改注意力」到底在改什么。

过去几年,大模型的故事,大部分围绕三个关键词:

  • 更大参数
  • 更长上下文
  • 更便宜

参数可以继续堆,显卡还能继续买,但真正卡住的是:

  1. 长上下文下的算力和显存成本(128K、1M token 级别)
  2. 企业最关心的:这个东西每个月是不是把预算烧穿

而这些问题,几乎都指向同一块:Self-Attention(自注意力)

标准 Transformer 里的 self-attention,本质是:

所有 token 和所有 token 两两互相算一遍

上下文长度翻 2 倍,计算量和显存占用基本涨到 4 倍(O(n²) 复杂度)。

当你想在一个模型里塞进 1M 个 token 的时候,这种玩法就非常疼。

所以 2024–2025 这两年,很多团队开始认真问一个问题:

能不能在 不推倒 Transformer 整体范式 的前提下,

把注意力这一块,换成更「省钱」的版本?

现在看下来,大致有三条主线:

  1. 继续用 Full Attention,但做极致的工程优化
  2. 走 Sparse Attention(稀疏注意力):不是人人都算,而是“只算最值得算的那一部分”
  3. 走 Linear Attention(线性注意力):直接把注意力公式改写成“对一个状态矩阵的增量更新”,把复杂度做到 O(n)

图 1:Dense Attention(左)需要对所有 token 两两计算注意力;Sparse Attention(右)只保留局部窗口 + 稀疏连接,计算量从 O(n²) 降到近似 O(n)。Linear Attention 可以理解为另一种思路:不再直接算完整注意力矩阵,而是维护一个随序列更新的状态。

而在这三条路线里:Qwen、Kimi、DeepSeek 的选择很有代表性:

  • Qwen:在线性注意力上押注,但用 混合架构 稳住效果
  • Kimi:更激进地 All-in 线性注意力,把它做成旗舰卖点
  • DeepSeek:主线还是 原生稀疏注意力(NSA / DSA),把 sparse 做到极致

下面我们就站在「边界层」上,把这三条路线拆开看看。


二、三个关键词:先把 Full / Sparse / Linear 讲明白

1. 【边界层内】Full Attention:效果强,但成本是硬伤

标准 self-attention 的做法,是所有 token 和所有 token 两两互相关注

  • 好处:
    • 任意两个位置都能建立联系,效果强、泛用性好
  • 坏处:
    • 复杂度 O(n²),上下文一长,显存、时延、费用一起飞

所以 Full Attention 在技术上近乎“默认标准答案”,但在成本上越来越难扛。

【边界层外】对我们意味着什么?

  • 做长文档、长对话、Agent 场景时:
    • token 越多,账单越可观
    • 1M context 如果完全用 Full Attention 做,很容易直接把“长上下文”变成一个只能写在 PPT 上的功能点
  • 对大模型平台或云厂商来说:
    • 想在 API 价格上卷,就必须在 attention 这里找到新的“省钱方法”

2. Sparse Attention:只算最值得算的那一部分

【边界层内】

Sparse 的思路是:

不是所有 token 都值钱,

我只让一部分 token 互相关注。

典型做法有:

  • 滑动窗口(local window):只看附近的一小段
  • 加少量 全局 token(global tokens)
  • 或者像 DeepSeek 那样,上一个类似「Lightning Indexer」的模块,先粗算一遍哪些 token 值得重点看,再精算那一小撮

本质是:不改变 Transformer 的整体结构,通过“聪明地丢掉一部分连线”来省算力

【边界层外】

  • 对工程体系比较稳的大厂来说,Sparse 有天然优势:
    • 不需要完全改算子
    • 可以在现有框架(如 vLLM / SGLang 等)里做“稀疏 kernel 优化”
  • 对自建推理、私有化部署的团队来说:
    • 稀疏注意力是一条很现实的“降本增效路线”:

      在不大改基础设施的前提下,把推理成本压一截


3. Linear Attention:把注意力变成“写一个记事本”

【边界层内】

Linear Attention 更激进:

与其让每个 token 和所有历史 token 两两算,

不如维护一个「状态矩阵」,

每看到一个新 token,就对这个矩阵做一次增量更新。

于是复杂度从 O(n²) 变成 O(n)。

代表性工作之一是 DeltaNet:用一个经典的 Delta Rule(增量更新规则) 来更新状态矩阵。

直觉上可以这么理解:

  • Full Attention

    每次开会,所有人互相都说一遍,还都记在脑子里

  • Linear Attention / DeltaNet

    办公室墙上有一块「白板」,大家轮流上去写重点,白板本身就是那块“状态记忆”

当然,怎么写、写多少、什么时候擦掉一部分,就是 Qwen / Kimi 这些团队在继续优化的内容。

【边界层外】

  • 把 attention 做成 O(n),理论上对 长上下文 + 流式生成 + Agent 这种任务非常友好
  • 但这条路有一个现实门槛:
    • 需要在 算法、训练配方、kernel、硬件 pipeline 上做一整套适配
    • 不再是“在现有 infra 上挂一个小模块”,而是实打实地“重新设计主力注意力模块

三、路线一:Qwen——Gated DeltaNet 混合架构

1. 【边界层内】Gated DeltaNet 做了什么?

图 2:DeltaNet 采用增量更新的「状态矩阵」来替代显式的 n×n 注意力矩阵,示意了随序列 chunk 迭代更新状态并并行计算输出的过程。

DeltaNet 是一类“用 Delta Rule 更新状态矩阵”的线性 Transformer,在很多 in-context retrieval(上下文检索) 任务上表现不错。

Qwen 在此基础上加了一层 门控(Gated)

每次是否要往记事本上认真写一行、写得轻一点、还是干脆略过——

交给模型自己学。

这个 Gate,本质上是一套「什么时候强记、什么时候弱记、什么时候不记」的策略。

更关键的是 3:1 混合架构

  • 大约 75% 的层用 Gated DeltaNet(线性注意力)
  • 25% 的层保留 Full Attention
  • 在网络里按 3:1 的比例交替排布 [3]

官方和社区的分析大致结论:

在「训练配方完全一样」的前提下,

这套混合架构在语言建模和下游任务上,都优于纯 Transformer baseline,

同时训练 & 推理成本更低。

这意味着:线性注意力不再只是“凑数的效率模块”,而是已经走进旗舰模型主干结构。


2. 【边界层外】Qwen 路线给我们的信号

从一个做产品 / 战略的视角,我会这样解读 Qwen:

  1. 不 All-in 线性,是一个偏稳健的决策
    • 当前生态(框架、插件、优化经验)基本都是围绕 Full Attention 打造

    • 线性注意力要成为“默认主力”,必须先证明:

      在相同参数和训练预算下,效果不差甚至更好

    • 3:1 混合是一种“风险可控的升级”:兼顾效果与成本

  2. 把线性 attention 从论文实验推向了工业主力
    • 当一个 80B 级旗舰模型,在 75% 的层上使用 Gated DeltaNet,这本身就是信号:

      未来两年,线性注意力会越来越多地出现在「生产主力模型」里

  3. 对生态伙伴 &大数据从业者意味着什么?
    • 之后的蒸馏、多模态扩展、私有化版本,很可能继承这套 attention 设计
    • 如果你在做和 Qwen 生态强绑定的应用(包括国产云上的企业方案),
      • 这会逐渐变成你默认要跟的“范式”

四、路线二:Kimi——Kimi Linear & KDA,把线性注意力拉满

如果说 Qwen 是“稳扎稳打上了线性注意力”,

Kimi Linear 更像是直接喊了一句:

我们押注线性注意力,

它不仅便宜,而且在一堆场景下 效果还更好

1. 【边界层内】Kimi Linear 的核心设计

根据论文和官方信息,[4]

  • 公平对比(训练配方一致) 的条件下,

    他们宣称在线性 attention 上全面超越 Full Attention

    • 覆盖短上下文、长上下文和 RL scaling
  • 相同训练设置下:

    • 1M context 下解码吞吐最高可提升到
    • KV cache 占用最多可降到原来的 25%

架构上:

  • 使用新的线性注意力模块:KDA(Kimi Delta Attention)
  • 3 层 KDA 插 1 层 MLA(Multi-Head Latent Attention)全局注意力,还是一个 3:1 混合结构

 

图 3:Kimi Linear 的基本 Block 结构,上:MLA + MoE,全局注意力层;下:KDA(Kimi Delta Attention)+ MoE,作为线性注意力主力层,整体按 3:1 交替堆叠。

和 Qwen 有点“英雄所见略同”,但细节更激进。

相比 Gated DeltaNet,KDA 在几个维度上做了强化:

  1. 门控粒度更细
    • Gated DeltaNet 多是 head 级别的控制
    • KDA 把 gate 开到 channel 级,每个特征维度有自己的遗忘率,状态矩阵用得更“抠门但精细”
  2. DPLR(Diagonal + Low Rank)Transition 的硬件友好实现
    • 状态更新矩阵被精心设计为 对角 + 低秩 结构
    • 再加上特制的分块算法,方便在 GPU / Tensor Core 上高效跑
  3. 算法 + kernel 一体化优化
    • 不是“写个新 attention 模块就完事”,而是和硬件执行 pipeline 绑在一起优化
    • 这也是为什么它能在 1M context 下拿出 6× 吞吐这种比较夸张的数字

2. 【边界层外】Kimi 路线的产品和业务意味

  1. 技术与产品叙事高度对齐

    • 产品定位:长文档 / 知识助手
    • 技术路线:押注长上下文友好的线性 attention
    • 官方叙事里反复出现的两个点:
      • 1M context 下 6× 吞吐
      • KV cache 降 75%

    对业务方来说,这是非常直接的指标:

    你可以在同样的硬件和预算下,做更多事情。

  2. 试图改写“线性注意力 = 效果差一点”的刻板印象

    过去的普遍认知是:

    • 线性 attention:省钱、省显存,但效果比 Full 差一点
    • 真正的旗舰模型,通常仍以 Full / Sparse 为主

    Kimi Linear 给出的新叙事是:

    在同等训练配方下,线性 attention 不仅不差,某些任务上反而更好。

    这会影响整个行业对线性注意力的心理预期。

  3. 把线性注意力推进到 Agent 场景

    很多解读会强调:

    • Kimi Linear 更适合 Agent:
      • 上下文极长、状态很多
      • KV 压力小、吞吐高
    • 再加上线性 attention 天然的“状态追踪”结构优势

    换句话说,它在尝试把自己变成:

    “下一代 Agent 用的底座,而不是一个便宜点的长上下文模型”

对我们这种做数据 / AI / 应用的人来说:

  • 如果你在做 知识库 / 文档问答 / Agent Workflow

    Kimi Linear 是未来两年很值得盯住的一条线路。


五、路线三:DeepSeek——把 NSA / DSA 稀疏注意力做到极致

DeepSeek 的主线和前两家有点不同:

目前公开强调的核心,不是线性 attention,而是自己的 NSA → DSA 稀疏注意力路线

 

图 4:DeepSeek Sparse Attention(DSA)的两阶段路径:先由 Lightning Indexer 粗打分,再在被选中的 Top-k token 上做精细注意力,从而在保留长程依赖的同时显著压缩计算量。

1. 【边界层内】NSA / DSA 在做什么?

NSA(Native Sparse Attention) 的思路大致是:

  • 一开始就按稀疏结构训练,而不是先 dense 再剪枝
  • 结合局部窗口 + 全局 token,对 token 做分层压缩和选择
  • 在 kernel / 系统上配合,实现真实吞吐提升

DeepSeek-V3.2 又推出了 DSA(DeepSeek Sparse Attention),[5] 可以理解为 NSA 的进化:

  • 加了一个极轻量的 Lightning Indexer
    • 用一个体积很小、FP8 精度的“迷你注意力模块”,给所有历史 token 打“重要性分”
    • 虽然理论复杂度仍是 O(n²),但算得很粗、很快
  • 主注意力只对被选中的那一小部分 token 做精算

等于把 dense attention 砍成两段:

  1. 极轻量的“预选阶段”(Lightning Indexer)
  2. 覆盖少数 token 的精算阶段

2. 【边界层外】DeepSeek 路线的现实考量

  1. 极致性价比导向

    • DeepSeek V 系列一个最鲜明标签就是“便宜”

    • 在这种总体策略下,attention 的自然问题是:

      如何在不彻底颠覆现有基础设施的前提下,把成本压到极致?

    稀疏注意力是一个非常自然的答案。

  2. 工程与系统视角很重

    • 相比重新设计 attention 数学形式,DeepSeek 更像是在问:
      • 稀疏模式怎么在 GPU / 集群上“真跑得快”?
      • 怎么兼容 vLLM / SGLang 等主流推理框架?
    • 这对想在本地或云上自建推理服务的团队很关键
  3. 不改算子本身,而是把“算哪些 token”做得极致聪明

    • 和 Kimi 的思路不同:

      Kimi 改的是“算子 + 状态结构”

      DeepSeek 改的是“筛选策略 + 稀疏模式

对实际项目方来说:

  • 如果你的 首要目标是 TCO / 自建推理成本

    DeepSeek 这条 NSA / DSA 路线是非常值得算账的一支:

    • API 端已经在价格上很激进 [7]
    • 自建时,稀疏架构进一步帮助节省显卡和能耗

六、三条路线放在一起:这是一个 Hybrid 时代

如果我们做一个很粗暴的二维坐标:

  • 横轴:对现有架构 / 工程体系的侵入程度
  • 纵轴:在长上下文 / Agent 场景中的潜在结构优势

可以大致这样定位:

  • Qwen:中等侵入 + 中高潜力
    • 线性 attention + Full Attention 的 3:1 混合
    • 强调“在相同训练配方下效果更好 + 成本更低”
  • Kimi Linear:高侵入 + 高潜力
    • 直接把 KDA 做成主力注意力
    • 在线性 attention 的可表达性与硬件适配上“梭了一步”
  • DeepSeek DSA:低算子侵入 + 高工程效率
    • 保留 Transformer 主体
    • 把“稀疏 + Indexer + 工程优化”做到极致
    • 非常适合讲“性价比 / 吞吐”的故事

对我们这些站在「边界层」上的人来说,更重要的问题不是“谁赢谁输”,而是:

在未来二三年,你接触到的大模型,大概率都会是各种 Hybrid Attention 的组合。

真正要看的,是每家在自己选定的 Hybrid 范式上:

  • 工程能不能跑顺
  • 生态能不能跟上
  • 成本和效果能不能同时站得住

七、【边界层外】对大数据 / AI 从业者,应该怎么用这三条路?

给一个非常“落地向”的 checklist:

  1. 做长文档 / 知识库 / Agent 产品时:

    • 优先关注 Kimi Linear 这一类线性 attention 路线
    • 看两个指标:
      • 在 512K / 1M 上的吞吐和时延
      • 上下文成本(token 价格 + KV cache 占用)
  2. 希望走更稳健的“国产生态主线”:

    • Qwen 的混合架构是一个很自然的选项:
      • 不放弃 Full Attention 的成熟经验
      • 又借线性 attention 把效率和长上下文能力拉上来
    • 对接各家国产云(含你之前阿里云同事所在的体系)时,这条线的兼容性和路线透明度会比较好观察
  3. 首要 KPI 是“性价比”和“可控的自建推理成本”:

    • 尤其是在:
      • 数据敏感、必须私有化
      • 预算有限但想堆多个模型的场景
    • DeepSeek 的 NSA / DSA 路线,是值得用 excel 真正算一遍 TCO 的:

    在相同业务指标下,

    你要多少卡、多少电、多少机房位、多少 API 费用?


八、写在最后:为什么非工程师也应该盯着注意力?

站在「边界层」这条线上,我会特别关注三点:

  1. 注意力不再是“论文里的数学公式”,而是进入了产品/商业叙事

    • Kimi 讲 Kimi Linear
    • DeepSeek 讲 NSA / DSA
    • Qwen 讲 Gated DeltaNet 混合结构

    这意味着:注意力的形态,已经变成可以对客户讲清楚的差异点。

  2. 真正的分水岭不是谁赢谁输,而是谁先把自己的 Hybrid 范式跑顺

    • 未来的旗舰模型,很可能都不是纯 Full / 纯 Sparse / 纯 Linear
    • 而是各种“混合结构 + 工程优化 + 硬件协同”的组合
    • 对我们来说,重要的是读懂每家在讲的那套 Hybrid 范式背后,到底在换什么成本、博什么收益
  3. 对非工程师来说,最重要的两个问题其实很简单:

    • 这条注意力路线,能不能显著降低我的总成本(钱 + 时间)?
    • 它在 长上下文 / 多轮任务 / Agent 场景 下,能不能拉开体验差距?

如果有一天,大部分人已经不再关心“你用的是 Full、Sparse 还是 Linear”,

就像今天很少有人关心手机 SoC 里哪一级 cache 有多大——

那可能意味着:下一代注意力范式,已经真正沉到底层,变成新的基础设施。

在那之前,我会继续站在这条「边界层」上,

尽量把这些看起来“很底层”的细节,翻译成我们能用得上的:

  • 产品判断
  • 成本决策
  • 以及对整个 AI 行业路线的长期理解。

部分配图引用自:

  • DeltaNet: Parallelizing Linear Transformers with the Delta Rule over Sequence Length 及作者博客;
  • Kimi Linear: Kimi Linear Tech Report 及相关技术解读文章;
  • DeepSeek Sparse Attention: DeepSeek-V3.2-Exp 技术报告与社区解析文章;
  • Dense/Sparse 对比:关于长上下文与稀疏注意力的公开技术博客。

✍️ 科里笔记 Coralyx Notes

Written by 科里(Coralyx),发表于「边界层」

如果你也是不写代码、但必须理解 AI 的行业人,欢迎关注这个号,一起在边界层上看世界。

 


Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐