腾讯混元 Hy3 正式版发布:295B 总参数只激活 21B,Agent 能力追平 GPT-5.5
腾讯混元 Hy3 正式版发布:295B 总参数只激活 21B,Agent 能力追平 GPT-5.5
2026 年 7 月 6 日,腾讯正式发布了混元 Hy3 的正式版本。作为 4 月底 Hy3 Preview 之后的首个稳定版,Hy3 在智能体(Agent)、代码生成、办公任务和复杂推理等方向实现了明显跃升,同时把 API 调用价格压到了"1 元/百万 tokens"的极低成本,并以 Apache 2.0 协议完全开源。一句话概括:这是一个总参数高达 2950 亿、但每次推理只激活 210 亿的"效率怪兽",也是目前国产大模型中 Agent 能力最强的选手之一。
本文带你从背景、架构、性能、开源与定价、应用场景到客观评价,全面认识混元 Hy3。
一、混元 Hy3 是什么来头?
混元是腾讯自研的大语言模型系列。2026 年上半年,腾讯对混元团队进行了底层重建——据公开报道,ReAct 论文作者、前 OpenAI 研究员姚顺雨加入腾讯后,用三个月时间重建了整个预训练与强化学习基础设施。
Hy3 的研发节奏非常清晰:
- 2026 年 4 月 23 日:腾讯发布 Hy3 Preview,这是底层重建后的首个版本,相比上一代 Hy2 在复杂推理、指令遵循、上下文学习、代码生成和智能体能力上均有质变。
- 2026 年 7 月 6 日:Hy3 正式版上线。架构沿用 Preview 的底层设计(总参数 295B、每次激活 21B),主要改进在于"提升后训练数据质量与多样性"以及"扩大强化学习(RL)算力规模"——换句话说,骨架没动,但喂给模型的训练数据更好了、更多样了,强化学习也给了更多算力。
在腾讯内部组织的 270 位专家盲测中,Hy3 以 2.67/4 的综合评分领先同期模型 GLM 5.1 的 2.51/4,在前端开发、数据与存储、CI/CD 等类别优势尤其明显。
二、核心架构:以小博大的 MoE 设计
Hy3 最大的工程亮点,是它用"混合专家(MoE)"架构实现了极致的参数效率。关键参数如下:
| 参数 | 数值 |
|---|---|
| 总参数量 | 295B(2950 亿) |
| 激活参数量 | 21B(210 亿,每次推理仅用约 7% 参数) |
| 架构 | Mixture-of-Experts(MoE) |
| 层数 | 80 层(不含 MTP 层) |
| 注意力 | 64 个 Query 头、8 个 KV 头(GQA 分组注意力) |
| 隐藏维度 | 4096,中间层维度 13312 |
| 专家数 | 192 个专家,Top-8 激活 |
| 上下文窗口 | 256K tokens |
| 精度 | BF16 |
| MTP 层 | 额外 3.8B 参数用于多 token 预测 |
| 思考模式 | 快慢思考融合(fast/slow thinking) |
为什么选 MoE? 核心思想很简单:不是每个问题都需要动用全部知识。面对简单问题,模型只需激活少量专家(Top-8)即可快速作答;面对复杂推理,则调动更多专家做深度思考。这让 Hy3 在保持 295B 知识容量的同时,把单次推理成本压到了与几 B~十几 B 小模型同量级,是"以小博大"的典型代表。
快慢思考融合是另一大特色:模型能在"快速响应"和"深度推理"两种模式间自动切换,既保证日常对话的流畅,又能在数学、科研等硬任务上展开长链思考。
三、性能表现:Agent 能力是它的王牌
Hy3 正式版最亮眼的成绩集中在智能体(Agent)与工具编排能力上:
- Agent 任务解决率 90%(Preview 版为 72%,提升 18 个百分点)——这是 Hy3 最大的卖点。
- 幻觉率 5.4%(Preview 版 12.5%,直接砍掉一半多),意味着它胡说八道的频率大幅降低。
- BrowseComp 84.2 分,几乎追平 GPT-5.5 的 84.4,在网页搜索类 Agent 任务上差距可忽略。
- GPQA Diamond 90.4 分(研究生级科学问答),逼近 GPT-5.5 的 93.6。
- SWE-Bench Verified 78.0 分,在国产模型中属于第一梯队(低于 GPT-5.5 的 84.4,但 Code 能力已不输主流)。
在 Agent 核心测试 ClawEval 上,Hy3 拿到 68.5 分,超过参数量是其 2~5 倍的 DeepSeek V4 Pro(62.4)和 Qwen 3.7 Max(65.2),"性价比极其炸裂"的评价由此而来。
客观短板也很清楚:数学推理是最大弱项。 在最难的数学测试 MathArena Apex 上,Hy3 仅得 38.7 分,而 GPT-5.5 高达 85.4,差距巨大。这也是 Hy3 后续迭代最值得期待的补强方向。
四、完全开源 + 白菜价
Hy3 在"开放"和"便宜"两件事上都非常激进:
- 开源协议:Apache 2.0。开发者可自由下载模型并用于商业场景。官方已 “day 0” 接入 Hugging Face、ModelScope 魔搭、GitCode 等社区。
- GitHub:
https://github.com/Tencent-Hunyuan/Hy3 - Hugging Face:
https://huggingface.co/tencent/Hy3 - ModelScope:
https://modelscope.cn/models/Tencent-Hunyuan/Hy3
- GitHub:
- API 定价(腾讯云 TokenHub):
- 输入:1 元 / 百万 tokens
- 输出:4 元 / 百万 tokens
- 输入命中缓存:低至 0.25 元 / 百万 tokens
对比同等能力的旗舰模型,这个价格几乎是"白菜价",对中小团队和个人开发者极其友好。
五、已经用在哪里?
Hy3 不是实验室里的玩具,而是已经深度嵌入腾讯产品矩阵:
- 腾讯元宝:基于 Hy3 的 Agent 能力提升,元宝上线了 Agent 能力——用户在对话中输入需求,元宝即可直接执行复杂任务并交付 PPT、Word、Excel、PDF、HTML 等文件,且全部免费。
- 开发工具链:已接入 WorkBuddy、CodeBuddy、ima 等腾讯内部产品,后续还将接入 OpenRouter、Hermes、Cline、CherryStudio 等海外平台。
- 生产力场景:官方强调 Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等任务上进步最为显著,定位为"高性价比的可靠选择"。
六、怎么客观评价 Hy3?
优势:
- Agent 能力国产第一梯队,解决率 90% 配合极低的幻觉率,让它特别适合"让模型自己干活"的自动化场景。
- 极致参数效率,295B 容量只激活 21B,推理成本低、部署门槛相对友好。
- 完全开源 + 1 元定价,对开发者极其友好,生态接入速度快。
- 256K 长上下文 + 快慢思考融合,兼顾长文档处理与深度推理。
不足:
- 数学推理是明显短板,MathArena Apex 仅 38.7 分,硬核数学/竞赛题上落后于顶级闭源模型。
- 代码能力中上但非顶尖,SWE-Bench Verified 78.0 仍低于 GPT-5.5 的 84.4。
- 作为较新的正式版,社区生态、第三方工具适配仍在快速成长中。
七、结语
腾讯混元 Hy3 正式版的发布,标志着国产大模型在"Agent 能力"这条赛道上迈出了关键一步。它用一套精巧的 MoE 架构证明了:强大的模型不一定需要昂贵的推理成本,而完全开源 + 极低定价的策略,也让更多开发者能够真正用起来。
如果你关注智能体、自动化办公、低成本私有化部署,或者只是想找一个好用的国产开源大模型,Hy3 绝对值得上手试一试。
参考来源:腾讯混元官方博客、Hugging Face 模型卡、36 氪 / InfoQ / 腾讯云开发者社区相关报道(2026-07-06 至 2026-07-12)。
更多推荐

所有评论(0)