智谱也来炸场了:GLM-4.6 正面硬刚 Claude 4.5,Coding 模型的中国时刻来了?
原本想着趁着假期一早开车回老家,结果从昨晚六点开始,AI 圈子里连续投下“核弹”,手机刷到半夜都停不下来。
一个接一个的重磅更新,简直就是“模型军备竞赛的现场版”:
DeepSeek-V3.2-Exp 上线,带来全新的稀疏注意力机制,推理成本砍掉 75%。价格直接打下来,一下子把友商逼到了墙角。
Anthropic Claude Sonnet 4.5 发布,依旧主打 Coding,速度和价格都有所优化,最长任务可跑 30 个小时。
智谱 GLM-4.6 登场,代码能力追平 Sonnet 4,上下文长度直接拉到 200K,还在国产芯片上实现 FP8+Int4 混合量化部署。
节奏快到有点窒息。Anthropic 两个月前才更新过版本,没想到这次国内厂商几乎是贴着点同步跟上。大家都看明白了:谁也没法再独占优势。
01 从 GLM-4.5 到 GLM-4.6:追上来的不仅是性能
如果说 DeepSeek 是靠 R1 在春节期间一战成名,那智谱从 GLM-4.5 开始,基本算是“越过山丘”了。
我身边不少工程师,Claude 断供那会儿,第一时间就切换到 GLM-4.5。API 层面几乎无缝衔接,在 Claude Code 里只改几行命令就能跑起来。大家用下来最大的评价就是:能顶上九成功力,便宜,还不肉疼。
写代码不是一次性消费,而是每天都要跑。Claude 之前的价格让人心里犯怵,而 GLM 给人的感觉是:稳、实用、放心。久而久之,很多团队干脆直接转过去了。
这次的 GLM-4.6,看得出智谱是“奔着 Claude 去”的。功能直指 Coding 场景,更新时机更是紧跟 Sonnet 4.5。
当然,硬要比较的话,Claude 那种能跑 30 小时长任务的稳定性,国内模型还差点火候。但这并不妨碍 GLM-4.6 成为一次关键突破。
三个亮点尤其值得说:
Coding 能力再上台阶:在七十多个编程场景测试里,GLM-4.6 已经能胜任复杂开发任务。
200K 上下文:等于一次性把一个中型代码仓库全塞进去,模型既能看全局,也能抓细节。
国产芯片适配:GLM-4.6 已经在寒武纪芯片和摩尔线程 GPU 上跑通。这不只是“能用”,更像是未来生态的一块拼图。
别忘了,智谱还在 Hugging Face 公布了完整的测试数据和轨迹,欢迎大家自己复现。换句话说:你可以不信宣传,但可以自己试。

02 更少的 Token,更快的速度
相比 4.5,新版在平均 Token 消耗上少了 30% 以上。
这听起来可能有点抽象,但如果换个说法就容易理解了:同样一个问题,用更少的话就能说清楚。
对企业来说,这意味着成本肉眼可见的下降;对个人来说,速度更快,延迟更低,尤其在 Coding 这种复杂任务里,体验差距会被放大。
很多人反馈,GLM-4.6 的回答明显更紧凑,废话少了,更快切入重点。
03 实测环节:模型到底能玩出什么花?
说了这么多,大家肯定更关心“实际能做什么”。所以我准备了几个直观的测试场景:
01 炫酷灯光秀
提示词:
创建一个 HTML 页面,模拟舞台灯光秀。不同颜色的光束随机扫射,随着节奏闪烁,并能用按钮切换“演唱会模式”和“派对模式”。
02 互动地球仪
提示词:
生成一个 3D 地球仪,支持鼠标拖拽旋转,展示主要城市的标注点,点击城市时显示当地时间和天气。
03 创意加载器
提示词:
使用 CSS 和 JavaScript 设计几个创意加载动画:像心跳一样的脉冲效果、彩色方块的循环拼图、带轨迹的小火箭发射。并提供开关按钮。
04 自动生成简历
提示词:
根据用户输入的姓名、技能和经历,自动生成一个单页简历的 HTML 文件,包含清晰的版式、配色和导出 PDF 的功能。

这些案例不是为了炫技,而是让大家直观感受到 GLM-4.6 在前端、交互和工具类开发上的表现。后端的朋友可能要说“不公平”,但等实际用在生产环境里,大家的直觉会更有参考意义。
回到开头的问题:GLM-4.6 能在国内第一代码模型的位置上坐多久?
答案可能是谁也说不准。但有一点可以确定:国内厂商的迭代速度,已经跟上来了。
头部闭源模型的进步似乎在放缓,而国产模型在部分场景里已经能做到“无感切换”。这是好事——因为选择变多了,价格变低了,工程师终于不用再被绑架在某一个模型身上。
智谱还推出了最低 20 元的 Coding 包月套餐,直接覆盖大多数工程师的日常使用量。现在升级后,还带上了图像识别和搜索能力。
对很多人来说,这可能是第一次觉得“国产模型真能顶上来”。
所以,这个假期,或许不妨试试 GLM-4.6。在 Coding 场景里,它已经足够给力。
了解更多AI资讯,职场思考,科技资讯,扫码加入群聊,解锁更多精彩内容

更多推荐


所有评论(0)