• 核心原因就一句:

  行业关注点从“单点理解任务”转到了“通用生成与智能体能力”,而这正好不是 BERT 最擅长的方向。

  具体看,有几层原因。

  1. 产品价值中心变了
  BERT 时代,大家主要做的是:

  - 文本分类
  - 情感分析
  - NER
  - 语义匹配
  - 排序

  这些都属于“理解任务”。

  大模型时代,最火的是:

  - 对话
  - 写作
  - 代码生成
  - 多轮推理
  - Agent
  - 工具调用

  这些更适合 GPT/LLaMA 这种 decoder-only 生成模型。

  2. GPT 类模型更像“通用接口”
  BERT 通常要按任务单独设计:

  - 分类头
  - 训练数据
  - fine-tune 流程
  - 任务专门评估

  而 GPT 类模型往往可以直接靠:

  - prompt
  - few-shot
  - instruction tuning

  去覆盖很多任务。

  所以工程上大家会感觉:
  一个大模型先顶很多场景。

  3. BERT 不擅长“看得见的惊艳能力”
  BERT 很强,但它的强项不容易被普通人直接感知。

  - 它能把分类做得很好
  - 它能把匹配做得很好
  - 它能当 reranker、embedding backbone

  但它不会像聊天模型那样:

  - 直接回答问题
  - 写文章
  - 写代码
  - 自主规划步骤

  所以“声量”天然不如生成式模型。

  4. 生态和资本都往生成式模型集中
  这几年最受关注的是:

  - ChatGPT 类产品
  - Copilot 类产品
  - 多模态模型
  - Agent 框架
  - 长上下文和工具调用

  这些都把开发者、媒体、投资、论文热点吸走了。
  BERT 没消失,但不再站在舞台中央。

  5. BERT 的训练范式不再是主角
  BERT 的核心是 masked language modeling。
  而现在主流基础模型更偏向:

  - 大规模自回归训练
  - 指令微调
  - RL/偏好对齐
  - 工具调用与推理增强

  所以主流技术路线也变了。

  但要注意:声量变小,不等于没用了。

  BERT 现在依然很有价值,尤其在这些场景:

  - 文本分类
  - 检索排序 / rerank
  - 句向量
  - 小模型本地部署
  - 垂直领域模型
  - 对延迟、成本很敏感的系统

  很多企业内部系统里,BERT 类模型其实还在稳定干活,只是不像大模型那样“显眼”。

  一句总结

  BERT 声量变小,不是因为它突然不行了,
  而是因为行业主战场从“理解几个固定任务”变成了“一个模型处理尽可能多的生成与交互任务”,而这个舞台更适合 GPT 类模型。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐