在这里插入图片描述

DeepSeek-V4-Pro有四个最重要的数字:

参数 代表什么 直接结论
1.6T 总参数 模型非常大,全部权重都要加载
49B 激活参数 每次生成只计算其中一部分参数
1M 上下文 最多支持约100万token
FP4+FP8 权重精度 已经压缩,但仍是数百GB级模型

先记住最容易被误解的一句话:

每次只激活49B,不等于这只是一个49B模型。

DeepSeek-V4-Pro的总权重是1.6T。49B只代表每次计算量,不代表模型大小,也不代表只需要几十GB显存。

它不是单卡模型,也不是普通工作站模型。完整运行和对外提供服务都需要多卡、多节点推理集群。

1.6T到底有多大?

T是万亿。1.6T就是1.6万亿参数,也就是16000亿参数。

这些参数需要保存在模型权重中。权重有多大,取决于每个参数使用多少位保存。

保存精度 1.6T权重理论体积
BF16/FP16 约3.2TB
FP8/INT8 约1.6TB
FP4/INT4 约800GB

800GB只是按4位计算的理论值,不包含运行时占用。

模型真正运行时,还需要额外空间存放:

  • 量化信息;
  • 推理框架;
  • 临时计算结果;
  • 多卡通信缓冲区;
  • KV Cache;
  • 同时运行的用户请求。

所以,800GB不是推荐显存,而是权重体积的理论低位参考。

49B是什么意思?

DeepSeek-V4-Pro每生成一个token,大约有49B参数参与计算。

49B决定的是单次计算压力,主要影响:

  • 生成速度;
  • GPU计算量;
  • 每个token的推理成本;
  • 多用户同时使用时的吞吐量。

1.6T决定模型要占多大空间,49B决定每次生成要做多少计算。

这两个数字必须一起看:

总参数看容量,激活参数看算力。

只看49B,会严重低估显存;只看1.6T,也会高估每个token实际参与的计算量。

为什么1.6T只激活49B?

因为DeepSeek-V4-Pro采用MoE架构。

MoE的中文名称是混合专家模型。模型内部包含大量专家模块,每次只选择其中一部分参与当前计算。

这样做可以:

  • 扩大模型总参数;
  • 控制每次计算量;
  • 提高推理效率;
  • 让不同模块形成不同能力。

但MoE不会减少需要保存的总权重。所有专家仍然要分布在GPU或多个计算节点上。

MoE还会带来新的部署要求:

  • 多张GPU之间必须高速通信;
  • 专家负载需要保持平衡;
  • 推理框架必须支持专家并行;
  • 显存够用不代表生成速度一定够快。

FP4+FP8已经压缩,为什么还是这么大?

DeepSeek-V4-Pro官方指令模型采用混合精度:

  • 大量专家参数使用FP4;
  • 多数其他参数使用FP8。

FP4用4位保存数据,FP8用8位保存数据。位数越低,权重越小,显存和带宽压力越低。

但DeepSeek-V4-Pro的基础规模是1.6T。即使经过低精度压缩,总体仍然是数百GB级。

低精度部署还要求GPU和推理框架支持对应格式。模型能够下载,不代表现有机器能够高效运行。正式采购前必须验证GPU型号、框架版本、计算内核和多卡通信能力。

1M上下文是不是越大越好?

1M表示模型最多支持约100万token的上下文。

上下文包括:

  • 用户输入;
  • 历史对话;
  • 系统提示;
  • 知识库检索结果;
  • 工具调用结果;
  • 模型生成内容。

上下文越长,模型一次能读取的内容越多,但成本也越高:

  • 首字响应更慢;
  • KV Cache更大;
  • 单次请求占用更多计算资源;
  • 同一套硬件能服务的用户更少。

支持1M是能力上限,不是日常推荐设置。

企业服务通常应限制上下文。普通问答使用8K-16K,文档和知识库使用32K-128K,确实需要处理超长内容时再提高上限。

KV Cache为什么直接影响并发?

KV Cache保存模型已经处理过的上下文状态。没有它,模型生成后续内容时需要反复计算前面的全部内容。

KV Cache占用会随着以下因素增加:

  • 对话长度;
  • 输出长度;
  • 同时请求数量;
  • 缓存精度;
  • 最大上下文设置。

DeepSeek-V4使用了更节省长上下文成本的混合注意力架构,但100万token仍然会占用大量资源。

因此,模型能加载成功,只能说明权重放得下。能否支持多人使用,还要看剩余显存、KV Cache和实际吞吐。

一张表看懂国内主力开放模型

截至2026年7月,国内主力开放模型的参数跨度已经从35B达到1.6T。

厂商与模型 总参数/激活参数 上下文 输入能力 许可证
深度求索 DeepSeek-V4 Flash 284B/13B;Pro 1.6T/49B 1M 文字 MIT
阿里 Qwen3.6-35B-A3B 35B/3B 262K 文字、图片 Apache 2.0
智谱 GLM-5.2 744B/40B 1M 文字 Apache 2.0
月之暗面 Kimi K2.5 1T/32B 256K 文字、图片、视频 Modified MIT
MiniMax MiniMax-M3 428B/23B 1M 文字、图片、视频 MiniMax Community
阶跃星辰 Step-3.7-Flash 198B/11B 256K 文字、图片 Apache 2.0
腾讯 Hy3 295B/21B 256K 文字 Apache 2.0
小米 MiMo-V2-Flash 309B/15B 256K 文字 Apache 2.0
蚂蚁 Ling-2.6-1T 1T/官方未明确列出 256K 文字 MIT

参数越大,通常意味着更高的知识容量和能力上限,也意味着更高的部署门槛。

选型不能只按参数排序。还要同时比较业务效果、许可证、上下文、响应速度、并发吞吐和三年维护成本。

DeepSeek-V4-Pro面向全球服务,需要多大集群?

DeepSeek没有公开实时全球token量、完整GPU数量和机房清单,因此无法得出“实际拥有多少张卡”的精确答案。下面是按照全量请求都由DeepSeek-V4-Pro承载所做的工程估算。

统一计算口径

硬件统一折算为8卡B200级推理节点。NVIDIA公布的DGX B200单机规格为:

  • 8张Blackwell GPU;
  • 1.44TB总GPU显存;
  • 14.4TB/s聚合NVLink带宽;
  • 最大功耗约14.3kW。

这套规格可以作为DeepSeek-V4-Pro单个完整副本的高端硬件参考,但不代表DeepSeek实际使用或能够采购该型号。H20、H800、国产加速卡或定制集群需要换算为等效算力和显存。

推理容量采用以下假设:

估算项目 采用数值
单个8卡节点聚合输出速度 1,500-2,500 token/s
集群平均有效利用率 70%
峰值、故障、升级冗余 额外增加50%
单个8卡高端节点采购价 350万-500万元
网络、存储、供电和机房增量 GPU节点成本的25%-40%

单节点吞吐不是官方DeepSeek数据,而是用于容量规划的工程假设。真实吞吐会随输入长度、思考模式、并发、缓存命中率和推理框架变化。

三档全球流量估算

全球实时token量没有公开数据,因此按每天1000亿、3000亿和1万亿输出token计算。这里的输出token应包含推理过程实际生成的token。

每日输出量 生产节点数量 GPU数量 节点硬件费用 含基础设施总投入
1000亿token 约1,000-1,700台 约8,000-13,600张 约35亿-85亿元 约45亿-120亿元
3000亿token 约3,000-5,000台 约24,000-40,000张 约105亿-250亿元 约130亿-350亿元
1万亿token 约10,000-16,500台 约80,000-132,000张 约350亿-825亿元 约440亿-1,150亿元

当前全球服务规模的中位判断

如果DeepSeek-V4-Pro承担全球头部AI应用级流量,采用每天3000亿输出token作为中位口径,硬件规模约为:

  • 3,000-5,000台8卡高端推理节点;
  • 24,000-40,000张B200级等效GPU;
  • 约4.3-7.2PB聚合GPU显存;
  • 约40-75MW数据中心总电力需求;
  • 约130亿-350亿元初始基础设施投入。

其中聚合显存按每节点1.44TB计算,应为约4.3-7.2PB。集群不会把所有显存合成一个模型,而是运行大量相互独立的模型副本,为不同地区和用户请求提供服务。

每年需要多少电费和运维费用?

按每台节点平均10-12kW IT功耗、数据中心PUE约1.25计算,3,000-5,000台节点对应约40-75MW总电力需求。

全年耗电量约3.5亿-6.6亿度。按数据中心综合电价0.6-0.9元/度计算:

  • 年电费约2亿-6亿元;
  • 网络、备件、服务器维保和机房运维通常还需每年数亿元;
  • 硬件按3-5年折旧,每年折旧成本可能达到数十亿元。

为什么实际数字可能更低?

  • 简单请求可以路由到DeepSeek-V4-Flash或更小模型;
  • 提示缓存可以减少重复输入计算;
  • 推测解码和批处理可以提高单节点吞吐;
  • 第三方云厂商可能承担部分API流量;
  • 不同地区可以共享弹性容量。

为什么实际数字也可能更高?

  • 深度思考会生成大量中间token;
  • 超长上下文显著增加预填充和缓存开销;
  • 全球服务需要多地域部署和灾备;
  • 高峰流量远高于全天平均值;
  • 安全审核、搜索、向量检索和其他模型也需要独立算力。

因此,2.4万-4万张高端GPU、130亿-350亿元基础设施投入可以作为DeepSeek-V4-Pro独立承担全球主力流量时的中位估算,而不是DeepSeek官方披露的实际资产数字。

最后记住四句话

1.6T是模型总规模,决定权重有多大。

49B是每次激活规模,决定单次计算有多重。

1M是上下文上限,越接近上限,并发成本越高。

FP4+FP8已经大幅压缩,但DeepSeek-V4-Pro仍然是数据中心级模型。

如果DeepSeek-V4-Pro独立承载全球主力流量,中位估算需要约2.4万-4万张高端GPU、40-75MW数据中心电力和130亿-350亿元初始基础设施投入。实际规模取决于流量、模型路由、缓存、推理优化以及第三方云厂商承担的请求比例。


说明:模型和DGX B200规格来自截至2026年7月14日公开的官方资料。DeepSeek未公开实时全球token量和完整硬件清单;文中的流量、单节点吞吐、节点价格及集群规模均为容量规划假设,不是DeepSeek官方披露数字。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐