最近斯坦福大学发布的全球2026年AI指数报告引起了很大关注,其中一些数据引起了很大热议。这篇文章是智能体刘老师对其中一些指数的冷思考,希望能从一个不同的角度提供一些也许更有争议的观点。这些观点也许有所偏颇,但希望能为中国人工智能事业发展提供一些不一样的参考,欢迎读者批评和指正。

注:以下【原文】指斯坦福报告中的内容简要表述,【思考】指智能体刘老师不成熟的想法。

【原文】中美顶级模型的差距仅为2.7%。

【思考】这个指数能反映实际模型差距吗?

这个指数确实非常吸引眼球,其计算来自于一个用户评测众包平台的评测数据。

图片

看到这个差距,估计很多人都会觉得惊讶,尤其是使用过不同模型进行较多日常工作的从业者。智能体刘老师也调查了下身边人的反应,大家普遍觉得这个指数反应出来差距是不是跟实际情况相比有点过小了。

除了个人体验感觉外,刘老师还想科普一下模型能力两个角度的评价方法:一个是训练得到的基座模型最大能力m,另一个是用户体验到的模型推理能力u。

对于前者,训练得到的基座模型最大能力,我们可以简单理解为大模型厂商将算力资源火力全开,用最佳模型结构和最优参数,反复迭代得到的一套最优模型配置,由此产生的最佳基座模型能力,这个最大能力可以认为是100分(m=100),是这个基座模型的能力上限。

对于后者,用户体验到的模型推理能力,受到很多因素的影响,用户能体验到的模型推理能力是小于模型最大能力值100的(u<m)。影响模型推理能力的因素包括:用户付费等级、用户当前状态、模型算力分配、模型推理参数设置等等。而且这些因素对模型推理能力的影响是一个黑盒子,用户无从得知。我们在使用大模型厂商的服务时,经常会有“呀,我怎么感觉大模型今天变笨了”,这就是因为这些因素的变化导致当时的模型推理能力下降,形成的“降智”现象。

综上,刘老师对斯坦福报告的中美模型差距指数,更愿意理解为:在该众包平台上测试用户体验到的模型推理能力差距指数。

而真实的基座模型最大能力指数的差异,到底有多大?随着国外大模型的闭源趋势,这一点是很难得到具体数值了。尤其是随着智能体技术的发展,目前几乎国外所有大模型厂商的能力,都已经不是单一基座模型的比拼了,而是多智能体协同的结果比拼。这种协同效益,会与基座模型的能力形成乘数效应,由此会更加放大模型所能提供的服务能力之间的差距。刘老师个人的观点,也许有失偏颇,但相信这个差异远不止2.7%这样的个位数。中国人工智能产业切不可以这个数值为基准进行规划和决策,需要以更冷静的态度评估真实差距。

今天的冷思考暂时分享到这,欢迎关注后续分享。也欢迎留言分享您的观点。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐