最近很多人关注 Anthropic 的那篇论文,关于大模型如何通过隐藏信号传递偏好。

很多人在喊“细思极恐”,觉得大模型小心思越来越重。但这事儿其实一点也不新鲜。对于真正咱们这些在一线做企业级服务的人来说,这种“不可控”的带来的质疑甚至毒打,我们早就经历过了。

前两年,当大模型还算新鲜玩意,大家都在为它能写出一首打油诗欢呼。现在呢?你把 AI 接入连锁超市的定价系统,或者工厂的供应链调度环节,你得到的更多是焦虑,哪怕它脑抽一次多订了点生鲜,一个连锁店门店一周的利润就全搭进去了。

上AI,想起来美,听起来过瘾,做起来心累。

对于金融、医疗或者任何涉及真金白银和高价值决策的场景来说,AI 的黑盒属性,这就是个业务死穴。现在越来越多的人张嘴就来:“大模型是依据概率生成内容”(这块以后可以专门聊一下,大模型到底是怎么生成内容的)

我们们不怕系统笨,就怕系统“自作聪明”。自作聪明引发了事故,你总不能在董事会上跟股东汇报说:“因为大模型的注意力机制在第十七层发生了偏移。”

话虽如此,但锅你肯定是甩不出去。

可解释性未必可解

所以现在涌现出了一大堆试图解决“可解释性”的项目。比如把 AI 的执行过程上链,试图用密码学结构来做审计追踪。听起来很高级,但这招在真实的落地应用里,管用吗?

在真实的财务审计里,查账查的是资金流水的来龙去脉和审批节点的合规性。把 AI 的输出结果记录在不可篡改的账本上,确实能证明“它确实下达了这个指令”,但这并没有解决“它为什么下达这个指令”的核心疑问。你只是给一张乱写的假账盖了个无法抹除的钢印。

至于 Anthropic 发现的隐藏信号问题,这就像是供应链网络里某个层级极深的代理商,账面上的进出货记录做得滴水不漏,暗地里却通过一些极难察觉的尾货批次在转移利润。只要它的内部决策机制不透明,外部的监督往往形同虚设。

这其实反映了整个行业重心的被动转移:从单纯追求“模型有多聪明”,转向了追求“结果有多可靠”。

黑盒可以不拆,但业务边界要锁

大厂们砸重金去探索大模型的内部机理,试图强行拆解黑盒。这事儿是对的,但这是科学家的事情。对于绝大多数需要立刻见到 ROI 的老板来说,这条路太漫长,做不起,更等不起。

想要让 AI 真正敢用、能用,务实的做法不是去生硬地拆解那个几千亿参数的黑盒子,而是给它套上极度严格的业务审批流。

当前唯一阻碍企业在 AI 应用见效的就是数据。不管黑盒内部的计算逻辑多神奇,如果它看不到正确的业务数据,它生成的分析就只是一堆废纸 。AI 要知道他自己应该到哪里去看数据才是正确的,AI 需要看到正确的合适的数据 。

你不需要知道黑盒里是怎么做矩阵乘法的,你只需要确保扔进去的原始账单是清晰无误的,且它最终输出的决策指令没有跳出公司的预算红线。

如果一个商品算上货架陈列和物流成本已经亏损了,AI 却只看前端销售额就建议你大力推广,未必是AI蠢,下次试试给它提供全盘的成本核算明细 。

企业需要的可追溯性,从来不是追溯神经网络的权重分布,而是追溯 AI 在做每一次决策时,到底调用了哪一条企业硬性规定,参考了哪一份维度的经营报表。当 AI 的每一步建议都能精准对应到企业自身真实的运转环节时,黑盒本身就不再具有破坏力。

结语

未来几年,真正在企业级市场用AI赚到钱的,一定会是那些懂得如何用最枯燥的业务常识去约束AI 的企业。

当你准备把一条生产线的生杀大权交给机器时,最让你睡不着觉的,究竟是它的算法里有没有幻觉,还是你根本不知道该去哪找它看过的那本账单?


关于作者:我是家宁,来自问视间科技,AI 应用赛道创业者。 每天都在技术理想和商业现实之间反复横跳。喜欢琢磨新技术的落地真相,也爱分享创业路上的避坑指南。欢迎评论区或私信聊聊。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐