封面

我的 Token 去哪了?一场被你忽视的"隐形税"

你以为你在用模型,实际上模型在用你的预算。

如果你最近用过 DeepSeek V4 Pro,你大概率注意到一个细节:同样的对话,V4 Pro 的账单比预期高一截。

不是幻觉。不是 bug。是真金白银。

问题出在一个你几乎看不见的东西上:Hidden Reasoning Tokens。


你的 Token 到底花在哪了?

先快速对齐概念。

当你问 AI 一个问题,整个过程分两步:

  1. 输入(Input)— 你的问题 + 上下文 + 系统提示词

  2. 输出(Output)— 模型的回复

绝大多数计费按这两个环节分别计费,输出通常比输入贵 2–4 倍。

但 DeepSeek V4 系列引入了一个新变量:推理 Token(Reasoning Tokens)。


DeepSeek V4 的"隐形账单"

DeepSeek V4 Pro 在回复你之前,会先进行内部推理——模型在生成最终答案前,会产出大量中间推理文本。这些推理 Token 不显示给你看,但照常计费

而且,这批推理 Token 按输出价格收费。

根据社区实测数据(非官方公布),在 medium 推理深度下,推理 Token 可占到总 Token 消耗的 50%–70%。 这意味着什么?

假设一次对话,可见输出只有 3,000 Token,但后台推理 Token 达到 7,000–10,000。总消耗 10,000–13,000 Token,其中 大半是你从来看不见的。

DeepSeek 提供了 reasoning_effort 参数(low / medium / high)。90% 的场景 low 足够。但在 medium 档位下,推理 Token 的成本可能远超你的想象。


国内主流模型 Token 计费对比(2026 年 5 月官方价格)

以下数据均来自各平台官方定价页面,截至 2026 年 5 月:

模型 输入 (¥/百万token) 输出 (¥/百万token) 备注
DeepSeek V4 Flash 1 2 轻量推理模型,性价比高
DeepSeek V4 Pro 3 (优惠价) / 12 (原价) 6 (优惠价) / 24 (原价) 2.5 折优惠至 5/31
Kimi K2.6 6.50 27 最新旗舰,长程代码能力强
豆包 seed-2.0-pro 3.2 9.6 字节最新旗舰
百度文心 4.5 4 16
通义千问 qwen3-max 2.5 10 平衡之选

⚠️ 关键发现:标价只是明面上的账单。DeepSeek V4 Pro 加上 hidden reasoning tokens 后,实际有效输出价格远高于 ¥6/百万 token。而 Kimi K2.6 虽然能力很强,但输出 ¥27/百万 token 的价格让它不适合高频对话场景。

国内主流模型API定价对比


各模型能力速览

模型 上下文 思考模式 适合场景
DeepSeek V4 Flash 1M 支持 日常主力,快速响应
DeepSeek V4 Pro 1M 支持 复杂推理,架构决策
Kimi K2.6 256K 支持 长程代码,多模态
豆包 seed-2.0-pro 字节旗舰,综合能力强
通义千问 qwen3-max 256K 支持 性价比均衡
百度文心 4.5 支持 百度生态首选

多模型组合策略:分级调用

核心原则:简单任务用便宜模型,复杂任务才上旗舰。

三层模型梯队

第一梯队(日常主力)→ DeepSeek V4 Flash / 豆包 seed-2.0-lite  - 文案润色、摘要提取、简单问答、格式转换  - 成本:输入 ≤1 + 输出 ≤2第二梯队(中高难度)→ DeepSeek V4 Pro(reasoning_effort=low)/ 通义千问 qwen3-max  - 代码调试、长文分析、技术翻译  - 成本:输入 1–3 + 输出 2–10第三梯队(硬核任务)→ Kimi K2.6 / DeepSeek V4 Pro(medium reasoning)  - 复杂架构设计、多步推理、需要多模态理解  - 成本:较高,仅按需使用

实战配方

  • 写公众号文章:DeepSeek V4 Flash 扩展提纲 → 通义千问 qwen3-max 补充案例 → V4 Flash 润色终稿

  • 调试复杂 Bug:先用 V4 Flash 定位,搞不定再切 V4 Pro(开 low reasoning)

  • 翻译长文:V4 Flash 直翻 → qwen3-max 校对

  • 长程代码重构:Kimi K2.6 → V4 Pro review

关键技巧:不要让 V4 Pro 做 Flash 能做的事。不要用 Kimi K2.6 做日常聊天。


五大 Token 节流铁律

1. 把 reasoning_effort 设成 low(必须)

DeepSeek V4 系列有 reasoning_effort 参数。90% 的场景 low 就够了。 只有以下情况开 medium/high:

  • 多步骤数学证明

  • 复杂架构决策

  • 需要回溯推理链路的调试

2. 控制上下文窗口

每次对话,所有历史消息都会重新发送给模型。聊了 30 轮之后,你的每一次提问都在为前 29 轮的废话买单。

做法

  • 长对话定期重置会话

  • 把关键信息写成摘要而不是贴原文

  • 用语义搜索而不是滚动翻历史

3. 摘掉不用的工具和 Skill

每加载一个 Skill,系统提示词就塞几百到几千 Token。如果你挂了 20 个 Skill 但只用一个,每次对话都在浪费 19 个 Skill 的 Token。

4. 系统提示词是最大的隐形税

Agent 配置中的系统提示词越长,每次调用的基础成本越高。把 5000 字的提示词压缩到 2000 字,一个月能省 30% 的预算。

5. 能本地跑的绝不云端跑

本地模型(Ollama + Qwen2.5 系列)零边际成本。以下任务完全可以用本地模型:

  • 代码补全

  • 格式转换

  • 语法检查

  • 简单分类任务


日/周 Token 消耗自检清单

  1. DeepSeek V4 Pro 的 reasoning_effort 是不是 low?

  2. 简单任务有没有在用 V4 Flash 而不是 V4 Pro?

  3. 上下文窗口是不是定期清?

  4. Skill 列表是不是定期瘦身?

  5. 系统提示词是不是能再压缩?

  6. 有没有可以迁到本地模型的任务?


最后的算术

假设你每天对话 200 轮,平均每轮 5,000 Token(含输入输出):

如果全部用 DeepSeek V4 Pro(medium 推理 + 优惠价)

  • 每日:200 × 5,000 = 1,000,000 Token

  • 输出占比约 40%(含推理)= 400,000 输出 Token

  • 每日成本:600,000 × 3 + 400,000 × 6 = 180 万 + 240 万 = ¥4.2/天

  • 每月约 ¥126

如果改用分层策略

  • 60% → V4 Flash:600,000 × 1 + 240,000 × 2 = 108 万

  • 30% → qwen3-max:300,000 × 2.5 + 120,000 × 10 = 195 万

  • 10% → V4 Pro(low):100,000 × 3 + 40,000 × 6 = 54 万

  • 每日成本约 ¥3.6/天

  • 每月约 ¥107

每月省 ¥19,降幅 15%。 加上 Skill 瘦身 + 系统提示词压缩,总降幅可达 25%–30%。


Token 不是免费的。那些你看不见的推理开销,正在悄悄吃掉你的预算。

去检查一下你的 reasoning_effort 设置。现在就去。


数据来源:各模型官方定价页面(2026 年 5 月)。DeepSeek V4 Pro 为优惠期价格,5/31 后恢复原价。推理 Token 占比来自社区实测,非官方公布数据。 免责声明:本文为技术分析,不构成投资建议。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐