百度文心5.1:参数砍到三分之一反而更强了?实测之后说几句真话
百度文心5.1:参数砍到三分之一反而更强了?实测之后说几句真话
本文整理自B站"鲲鹏Talk"对文心大模型5.1的测评视频,基于AI好记转写。
模型概况
百度在5月正式发布了文心大模型5.1,基于5.0训练。几个关键数据:
- 总参数压缩到原来的1/3
- 激活参数压缩到1/2
- Arena搜索榜全球第四、中文领域第一
- MME26上超过了DeepSeek-V4-Pro和Gemini 3.1 Pro
压缩了参数反而更强了?这个反直觉的结果确实是亮点,但百度并没有公开具体是怎么做到的。没有论文,模型也没开源,只给了排行榜分数。
实测表现:有亮点,但也有明显短板
博主做了几个实际测试:
数学题(注水问题):思考约1分钟,答案正确(8小时24分钟)。✅
逻辑推理题(谁坐在B的对面):思考了接近5分钟,答案是错的,正确答案应该是C。❌
Python编程(滑动窗口+哈希表):写得完全没问题。百度不愧是编程领域的老底子。✅
网页创作:号称文本生成能力强,但实际展示效果一般——两边空白太多,风格跟上一代模型差不多。
总结来说:编程是强项,逻辑推理有短板,文本创作"排行榜上很强但实测感觉不到"。
百度的困境:做得早,但没人讨论了
博主提到了一个很扎心的现象:百度是国内最早做大模型的公司,AI领域的"黄埔军校",但现在在国内大模型圈子里,很少有人讨论百度的模型了。
文心5.1在外网推特上还有一些人在讨论,但在国内几乎没什么声量。
如果连讨论都没有,不管是黑他也好,说他好或坏都可以。如果连讨论都没有,那这个模型真的就是不行了。
对比一下:腾讯混元三模型请了一个大牛,3个月就做出可交付版本。小米vimo挖了一个人,马上推出接近V4水平的模型。百度这么多人,做不出同等水平的东西?博主的建议是:如果是人不行,赶紧换人。
百度其实也做了不少开源工作——ERNIE-45开源了,有28B和21B的VR模型,有5B的CR模型(OCR领域很强),还有33个模型在平台上。但因为没有一个足够亮眼的旗舰模型撑场面,所有这些努力都被淹没了。
几句真话
文心5.1到底行不行?从排行榜分数来看确实不错,但实测的体验有落差。这其实是百度目前最大的问题:分数和口碑之间存在巨大的鸿沟。
排行榜分数是可以优化的——选择性地针对评测标准做调优,分数就能上去。但用户真正用的时候,体验是另一回事。逻辑推理做不出来、文本生成跟上一代差不多,这些才是用户感知到的"真实水平"。
百度需要的不是更多的排行榜第一,而是一个让用户真正觉得"好用"的模型。就像博主说的:希望百度能追上第一梯队。
百度加油吧。
更多推荐


所有评论(0)