深度求索近期将 V4-Pro 大模型定价大幅下调 75%,这本该是面向企业 AI 服务商与开发者的重磅利好消息。但现实截然相反:大量从业者发现,模型降价并不会自动拉高企业利润。

背后逻辑十分清晰:虽然推理成本大幅跳水,但智能体(Agent)系统消耗 Token 的增速,远超模型单价下跌的速度。过去二十年间,软件行业始终遵循同一套经济规律:基础设施成本逐年走低,应用功能持续迭代升级。行业最初预判 AI 赛道会复刻这套发展逻辑。随着前沿大模型性能迭代、Token 单价持续下调,多数人曾笃定,推理开销终将沦为可忽略不计的运营成本。但如今,这一设想正以指数级速度崩塌。

普通聊天机器人,用户一条提问仅触发一次模型调用;而智能体需要完成一连串动作:规划思路、检索资料、调用工具、结果核验、内容总结、后续决策。用户最终只看到一条回复,但服务商要为整套循环流程买单。这就是百倍成本难题:同样一条用户请求,交由智能体工作流处理,成本会远高于普通对话机器人或检索增强生成(RAG)方案;长流程业务场景下,成本放大倍数会更高。模型降价虽能缓解压力,却无法根治产品架构缺陷 —— 单次用户提示词,会拆解为数十次计费运算。

各大模型厂商面向开发者的定价策略,足以体现当下行业面临的成本压力。OpenAI 推出扶持计划,为每家 YC 孵化器初创企业提供 200 万美元 API 额度。放在以往任何一轮科技周期,这笔资金足以覆盖完整种子轮融资;而过去同类初创企业仅需数千美元云服务器额度就能运转。这项扶持政策早已不只是人才招募福利,更直白印证:AI 原生企业首年产品落地,需要极高的算力投入。传统企业若要在现有产品线中嵌入智能体,整体成本规模只会更高。

何为 Token 放大效应

单轮对话机器人:用户一条消息仅触发一次模型调用,输入计费 Token 比例约 1:5。
覆盖客服、销售、财务、法务审核、工程研发的多步骤智能体,计费比例普遍达到 1:700 甚至更高。每一轮流程循环,都会完整留存历史对话、工具返回内容、推理全过程,所有步骤持续追加 Token,无任何精简删减。

举一个看似简单的智能体查询需求:“我们上周核心客户都咨询了哪些问题?”,想要输出最终答案,需要走完 7 步计费运算:

  1. 用户提示词(约 50 个 Token)
  2. 系统提示词 + 工具定义(约 3000Token,每次调用重复加载)
  3. 知识库检索(约 5000Token 上下文信息)
  4. 第一次模型调用:工具筛选(输入 8000Token,输出 200Token)
  5. 工具执行(返回 4000Token 内容)
  6. 第二次模型调用:内容总结(输入 12000Token,输出 400Token)
  7. 第三次模型调用:后续判断决策(输入 12400Token,输出 100Token)

用户仅输入一句话,最终计费输入 Token 总量近 35000。使用前沿大模型处理单次查询,成本区间在 0.1–0.4 美元。若企业 B 端产品每月百万次查询(行业基础业务体量),仅这项开销就达六位数美金。

现有 AI 商业模式为何彻底失效

企业 AI 主流收费模式一直是按席位订阅 SaaS:按月收取单人使用费,向客户交付智能体能力,赚取差价利润。这套模式建立在一个核心前提:单用户成本可控、浮动范围小。

Token 放大效应直接击碎该前提。一款 40 美元 / 席位 / 月的订阅产品,重度用户每日触发 50 次智能体任务,产生的推理成本甚至会超过订阅收费。Token 放大效应彻底瓦解传统 SaaS 定价逻辑:重度使用者产生的算力成本,可能高于每月支付的服务费,企业毛利率直接转负。更矛盾的是,客户深度使用智能体、业务价值提升,反而会持续压缩服务商利润,这恰恰是企业向董事会主推的增长路线。多家服务商私下透露,重度用户板块毛利率已为负数;与 Bessemer 基金 “超新星” 企业云成本报告结论一致:智能体落地规模与毛利率下滑高度绑定,从理论风险变成企业利润表核心拖累项。

相关行业乱象已开始公开曝光。彭博本周报道,Salesforce 旗下 Agentforce 宣传演示效果,与实际交付客户的功能存在巨大落差。这种落差出现的核心原因:宣传功能技术上可行,但按照席位订阅定价,提供服务完全不赚钱。Salesforce 只是最受关注的案例,行业内同类问题比比皆是。

英伟达应用深度学习副总裁布莱恩・卡坦扎罗坦言:“对我们团队而言,算力开销早已远超人力成本。”

这件事传递的战略信号并非 “AI 很贵”,而是绝大多数 AI 原生企业商业计划书依托的主流商业模式,完全无法适配智能体业务负载。

直观案例

某企业软件服务商推出 AI 客服助手,单人每月订阅费 40 美元。传统聊天机器人单日单用户推理成本仅几美分,毛利率十分可观。
若替换为完整智能体工作流:自主处理工单、调取内部系统、撰写回复、校验内容、异常升级。重度用户每日发起 50–100 次智能体请求,算力消耗直接提升一个数量级。曾经微不足道的基础设施开销,变成大额固定运营支出。

由此催生反常行业现状:产品价值感知最强的客户,往往带来最高算力成本。极端场景下,平台活跃度最高的用户,反而贡献最低利润。如今所有企业软件厂商都意识到:智能体渗透率提升,和企业利润增长不再正向绑定。

智能体调度层:全新行业护城河

行业已形成统一、成熟的技术解决方案,虽无颠覆性创新,但却是企业活下去的关键:

  1. 成本感知路由调度:轻量分类模型自动判断每条请求匹配对应算力档位(对标 Haiku、Sonnet、Opus 分级模型)。调优完善的调度系统可削减 60% 推理开支,且不降低输出质量。
  2. 提示词缓存:Anthropic、OpenAI、谷歌均针对缓存前缀提供 75%-90% 大额折扣。
  3. 上下文管控:截断工具返回冗余内容、精简推理记录、限制工具调用层级,避免智能体无限循环消耗 Token。
  4. 推测解码:私有化部署场景下,同等 GPU 硬件可实现 2–3 倍有效吞吐量。

IBM 调研数据:搭建完整调度治理体系的企业,整体生产效率提升幅度,是仅做合规管控企业的 6 倍。

能够搭建优质调度中间层的企业,发展逻辑不再是简单微服务运维,而是对标金融交易系统:每一条调度路径核算成本、每条业务链路独立盈亏、每个客户租户设置算力计量预算。

企业管理者落地四大核心举措

未来 24 个月,能守住利润的企业,都在执行以下四项动作:

  1. 将推理成本列为核心一级指标。按功能、客户租户、查询类型拆分追踪,复刻 2010 年代中期企业精细化管控云成本的思路。
  2. 效仿媒体投放做预算管控。为每个功能设置千次查询成本上限,硬性封顶,超支自动预警;仅靠研发团队无法自发管控成本。
  3. 把调度路由视作核心基础设施,而非次要优化手段,等同于新一代流量负载均衡器。
  4. 按季度复盘优化提示词。历时半年无序迭代、膨胀至 4000Token 的系统提示词,会持续产生高额隐性成本,多数团队从未完整通读生产环境提示词。
  5. 提前签订大额预购算力协议。前沿大模型厂商现已推出预留实例式预付套餐,折扣力度极大;标价永远是企业采购的最高成本。

未来 24 个月行业走向

智能体 AI 底层结构性矛盾,不在于算力昂贵。正如本次深度求索大幅降价所示,前沿模型单位推理成本每年降幅约 3 倍,降价趋势并未放缓。

真正核心矛盾:Token 放大速度,远超模型降价速度。即便单 Token 单价下调 75%,若智能体单次用户请求消耗 Token 量是定价模型预估的 700 倍,降价毫无意义。自云计算普及以来,企业架构决策第一次实时等同于财务决策:一次提示词重构,直接影响整体毛利率;无约束的智能体循环,等同于持续烧钱的线上故障。

未来两年能穿越算力定价周期存活的企业,不靠低价模型,而是拥有一套懂成本、会控耗的智能体调度体系。

这就是百倍成本难题,它到来的速度,远快于模型降价能掩盖问题的速度。

DeepSeek cut prices 75%. The 100x problem remains | VentureBeat

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐