在这里插入图片描述

在这里插入图片描述

子玥酱 (掘金 / 知乎 / CSDN / 简书 同名)

大家好,我是 子玥酱,一名长期深耕在一线的前端程序媛 👩‍💻。曾就职于多家知名互联网大厂,目前在某国企负责前端软件研发相关工作,主要聚焦于业务型系统的工程化建设与长期维护。

我持续输出和沉淀前端领域的实战经验,日常关注并分享的技术方向包括 前端工程化、小程序、React / RN、Flutter、跨端方案
在复杂业务落地、组件抽象、性能优化以及多端协作方面积累了大量真实项目经验。

技术方向:前端 / 跨端 / 小程序 / 移动端工程化
内容平台:
掘金、知乎、CSDN、简书
创作特点:
实战导向、源码拆解、少空谈多落地
文章状态:
长期稳定更新,大量原创输出

我的内容主要围绕 前端技术实战、真实业务踩坑总结、框架与方案选型思考、行业趋势解读 展开。文章不会停留在“API 怎么用”,而是更关注为什么这么设计、在什么场景下容易踩坑、真实项目中如何取舍,希望能帮你在实际工作中少走弯路。

子玥酱 · 前端成长记录官 ✨
👋 如果你正在做前端,或准备长期走前端这条路
📚 关注我,第一时间获取前端行业趋势与实践总结
🎁 可领取 11 类前端进阶学习资源(工程化 / 框架 / 跨端 / 面试 / 架构)
💡 一起把技术学“明白”,也用“到位”

持续写作,持续进阶。
愿我们都能在代码和生活里,走得更稳一点 🌱

引言

最近两年,大模型行业出现了一个很有意思的现象。很多公司发现:

训练成本越来越低

推理成本越来越高

以前大家讨论最多的是:

GPT-4
Claude
DeepSeek
Llama
Qwen

现在大家讨论更多的是:

vLLM
TensorRT-LLM
SGLang
PD分离
KV Cache

原因很简单,训练只发生一次,推理却发生无数次。假设训练一个模型花费:

100万美元

如果每天有100万用户使用:

每天推理成本
可能超过训练成本

很多企业真正面临的问题已经不是:

模型能不能做出来。

而是:

模型做出来以后,养不养得起。

因此今天我们从底层架构角度来看一个问题:

为什么大模型推理这么贵?

一、推理成本到底花在哪里

很多人第一次接触大模型时都会产生一个错觉:

用户提一个问题

模型返回一个答案

结束

看起来和调用一个 API 没什么区别。实际上并不是,用户看到的是:

你好

模型返回:

你好,请问有什么可以帮助你?

但 GPU 看到的是:

Embedding

↓

Transformer Layer 1

↓

Transformer Layer 2

↓

Transformer Layer 3

...

↓

Transformer Layer N

↓

Sampling

如果是:

70B模型
80层Transformer

那么生成一个 Token:

80层全部执行一次

生成1000个 Token:

执行1000轮推理

因此推理本质上是:

实时计算

而不是:

查询数据库

二、最昂贵的不是参数,而是时间

很多人觉得:

70B模型贵

7B模型便宜

这句话只说对了一半,真正决定成本的往往不是:

模型大小

而是:

GPU占用时间

例如,一张 GPU 每小时成本:

20 美元

如果请求持续:

10秒

和:

100秒

成本差异就是:

10倍

所以对于推理系统来说:

Latency
=
Money

延迟越高,成本越高。

三、Transformer 的天然缺陷

Transformer 最大的问题来自:

Attention

假设输入:

今天北京天气怎么样

生成最后一个 Token 时,它需要关注:

今天
北京
天气
怎么样

所有历史 Token,Attention 计算:

Q × K

序列长度为 N 时:

O(N²)

复杂度,意味着:

Context翻10倍

计算量翻100倍

这也是为什么:

128K Context

比:

8K Context

昂贵得多。

四、KV Cache:推理系统最大的显存杀手

为了避免重复计算,行业引入:

KV Cache

核心思想:

历史Token已经算过

不要重复算

例如:

Token1
Token2
Token3

生成时,第一次生成:

计算KV

后续:

直接读取缓存

理论上很好,但问题来了。

KV Cache 不消耗算力

却消耗显存,例如:

Llama 70B

32K Context

KV Cache 往往达到:

几十GB

甚至:

超过模型权重

因此很多推理系统的现状是:

GPU没被算满

显存先被占满

这也是为什么:

AI推理
=
显存战争

五、真正烧钱的是并发

假设:

一个用户

访问系统,成本其实并不高。真正恐怖的是:

10000个用户同时在线

因为每个用户都有:

独立上下文

独立KV Cache

例如:

用户A
32K Context

用户B
32K Context

用户C
32K Context

需要保存:

三份KV

无法共享,因此:

并发增长

往往意味着:

显存线性增长

六、为什么 GPU 利用率这么低

很多企业发现一个奇怪现象:

GPU 很贵

但是:

GPU 利用率只有30%

为什么?因为推理存在两个阶段。

Prefill

用户输入:

一篇5000字文档

系统需要:

一次性建立KV Cache

GPU计算极重,利用率接近:

100%

Decode

开始生成答案:

Token

↓

Token

↓

Token

这个阶段:

GPU计算量下降

但是:

时间极长

于是出现:

GPU一直占着

却没有满负载运行

导致:

利用率下降

七、为什么 PD 分离突然火了

最近 AI Infra 圈最火的话题之一:

PD Separation

即:

Prefill

↓

Decode

分离部署,传统模式:

GPU同时负责

Prefill
+
Decode

问题:

资源利用率低

PD 分离后:

Prefill Cluster

↓

Decode Cluster

各自优化,好处:

GPU利用率提升

吞吐提升

成本下降

目前很多超大规模推理平台已经采用这种架构。

八、MoE 为什么越来越流行

传统 Dense Model:

每次推理

全部参数激活

例如:

600B参数

全部参与计算,成本极高。

MoE:

600B参数存在

但只激活30B

例如:

Expert 1

Expert 2

Expert 3

只选择部分 Expert,因此:

参数规模巨大

推理成本可控

这也是 DeepSeek 等模型受到关注的重要原因。

九、Agent 正在放大推理成本

很多人觉得:

Agent
=
更聪明聊天机器人

实际上不是,一个普通 Chat:

1次请求

1次响应

结束。

而 Agent:

规划

↓

搜索

↓

调用工具

↓

分析

↓

总结

可能涉及:

10次

20次

100次

模型调用,于是出现:

用户问一个问题

系统执行几十次推理

成本瞬间放大。

十、推理系统真正的成本结构

很多人以为:

推理成本

=

模型成本

实际上到了企业级阶段,成本结构通常变成:

GPU资源

KV Cache

网络通信

调度系统

存储系统

监控系统

即:

AI Infrastructure

很多时候:

模型成本

<

基础设施成本

十一、为什么 vLLM 会成为行业标准

因为它解决了推理系统最大的痛点:

KV Cache 管理

传统方案:

显存碎片严重

大量 GPU 被浪费。

vLLM 引入:

PagedAttention

借鉴操作系统:

虚拟内存分页

思想。

把 KV Cache:

拆成Block

动态管理,效果:

吞吐提升

显存利用率提升

单位请求成本下降

所以很多公司上线大模型第一件事不是换模型,而是:

换推理引擎

十二、未来最大的成本黑洞

未来推理成本不会来自:

模型参数

而来自:

长上下文

Agent

多Agent

实时推理

持续记忆

例如:

1M Context

Agent Runtime

Memory System

都会带来巨大的:

KV Cache开销

因此未来 AI Infra 的核心竞争力很可能不再是:

谁模型最大

而是:

谁的推理系统最便宜

总结

如果用一句话解释大模型推理为什么这么贵:

因为大模型不是在“查答案”,而是在用数百亿参数实时计算每一个 Token。

从工程角度来看,推理成本主要来自五个方面:

Attention计算

KV Cache显存

GPU占用时间

高并发请求

Agent多轮调用

过去 AI 行业竞争的是:

训练能力

而未来 AI 行业竞争的核心将变成:

推理效率

因为训练决定模型的能力上限。而推理,决定一家 AI 公司能否真正活下来。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐