腾讯混元 Hy3 正式版发布:295B 总参数只激活 21B,Agent 能力追平 GPT-5.5

2026 年 7 月 6 日,腾讯正式发布了混元 Hy3 的正式版本。作为 4 月底 Hy3 Preview 之后的首个稳定版,Hy3 在智能体(Agent)、代码生成、办公任务和复杂推理等方向实现了明显跃升,同时把 API 调用价格压到了"1 元/百万 tokens"的极低成本,并以 Apache 2.0 协议完全开源。一句话概括:这是一个总参数高达 2950 亿、但每次推理只激活 210 亿的"效率怪兽",也是目前国产大模型中 Agent 能力最强的选手之一。

本文带你从背景、架构、性能、开源与定价、应用场景到客观评价,全面认识混元 Hy3。

一、混元 Hy3 是什么来头?

混元是腾讯自研的大语言模型系列。2026 年上半年,腾讯对混元团队进行了底层重建——据公开报道,ReAct 论文作者、前 OpenAI 研究员姚顺雨加入腾讯后,用三个月时间重建了整个预训练与强化学习基础设施。

Hy3 的研发节奏非常清晰:

  • 2026 年 4 月 23 日:腾讯发布 Hy3 Preview,这是底层重建后的首个版本,相比上一代 Hy2 在复杂推理、指令遵循、上下文学习、代码生成和智能体能力上均有质变。
  • 2026 年 7 月 6 日:Hy3 正式版上线。架构沿用 Preview 的底层设计(总参数 295B、每次激活 21B),主要改进在于"提升后训练数据质量与多样性"以及"扩大强化学习(RL)算力规模"——换句话说,骨架没动,但喂给模型的训练数据更好了、更多样了,强化学习也给了更多算力。

在腾讯内部组织的 270 位专家盲测中,Hy3 以 2.67/4 的综合评分领先同期模型 GLM 5.1 的 2.51/4,在前端开发、数据与存储、CI/CD 等类别优势尤其明显。

二、核心架构:以小博大的 MoE 设计

Hy3 最大的工程亮点,是它用"混合专家(MoE)"架构实现了极致的参数效率。关键参数如下:

参数 数值
总参数量 295B(2950 亿)
激活参数量 21B(210 亿,每次推理仅用约 7% 参数)
架构 Mixture-of-Experts(MoE)
层数 80 层(不含 MTP 层)
注意力 64 个 Query 头、8 个 KV 头(GQA 分组注意力)
隐藏维度 4096,中间层维度 13312
专家数 192 个专家,Top-8 激活
上下文窗口 256K tokens
精度 BF16
MTP 层 额外 3.8B 参数用于多 token 预测
思考模式 快慢思考融合(fast/slow thinking)

为什么选 MoE? 核心思想很简单:不是每个问题都需要动用全部知识。面对简单问题,模型只需激活少量专家(Top-8)即可快速作答;面对复杂推理,则调动更多专家做深度思考。这让 Hy3 在保持 295B 知识容量的同时,把单次推理成本压到了与几 B~十几 B 小模型同量级,是"以小博大"的典型代表。

快慢思考融合是另一大特色:模型能在"快速响应"和"深度推理"两种模式间自动切换,既保证日常对话的流畅,又能在数学、科研等硬任务上展开长链思考。

三、性能表现:Agent 能力是它的王牌

Hy3 正式版最亮眼的成绩集中在智能体(Agent)与工具编排能力上:

  • Agent 任务解决率 90%(Preview 版为 72%,提升 18 个百分点)——这是 Hy3 最大的卖点。
  • 幻觉率 5.4%(Preview 版 12.5%,直接砍掉一半多),意味着它胡说八道的频率大幅降低。
  • BrowseComp 84.2 分,几乎追平 GPT-5.5 的 84.4,在网页搜索类 Agent 任务上差距可忽略。
  • GPQA Diamond 90.4 分(研究生级科学问答),逼近 GPT-5.5 的 93.6。
  • SWE-Bench Verified 78.0 分,在国产模型中属于第一梯队(低于 GPT-5.5 的 84.4,但 Code 能力已不输主流)。

在 Agent 核心测试 ClawEval 上,Hy3 拿到 68.5 分,超过参数量是其 2~5 倍的 DeepSeek V4 Pro(62.4)和 Qwen 3.7 Max(65.2),"性价比极其炸裂"的评价由此而来。

客观短板也很清楚:数学推理是最大弱项。 在最难的数学测试 MathArena Apex 上,Hy3 仅得 38.7 分,而 GPT-5.5 高达 85.4,差距巨大。这也是 Hy3 后续迭代最值得期待的补强方向。

四、完全开源 + 白菜价

Hy3 在"开放"和"便宜"两件事上都非常激进:

  • 开源协议:Apache 2.0。开发者可自由下载模型并用于商业场景。官方已 “day 0” 接入 Hugging Face、ModelScope 魔搭、GitCode 等社区。
    • GitHub:https://github.com/Tencent-Hunyuan/Hy3
    • Hugging Face:https://huggingface.co/tencent/Hy3
    • ModelScope:https://modelscope.cn/models/Tencent-Hunyuan/Hy3
  • API 定价(腾讯云 TokenHub)
    • 输入:1 元 / 百万 tokens
    • 输出:4 元 / 百万 tokens
    • 输入命中缓存:低至 0.25 元 / 百万 tokens

对比同等能力的旗舰模型,这个价格几乎是"白菜价",对中小团队和个人开发者极其友好。

五、已经用在哪里?

Hy3 不是实验室里的玩具,而是已经深度嵌入腾讯产品矩阵:

  • 腾讯元宝:基于 Hy3 的 Agent 能力提升,元宝上线了 Agent 能力——用户在对话中输入需求,元宝即可直接执行复杂任务并交付 PPT、Word、Excel、PDF、HTML 等文件,且全部免费。
  • 开发工具链:已接入 WorkBuddy、CodeBuddy、ima 等腾讯内部产品,后续还将接入 OpenRouter、Hermes、Cline、CherryStudio 等海外平台。
  • 生产力场景:官方强调 Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等任务上进步最为显著,定位为"高性价比的可靠选择"。

六、怎么客观评价 Hy3?

优势:

  1. Agent 能力国产第一梯队,解决率 90% 配合极低的幻觉率,让它特别适合"让模型自己干活"的自动化场景。
  2. 极致参数效率,295B 容量只激活 21B,推理成本低、部署门槛相对友好。
  3. 完全开源 + 1 元定价,对开发者极其友好,生态接入速度快。
  4. 256K 长上下文 + 快慢思考融合,兼顾长文档处理与深度推理。

不足:

  1. 数学推理是明显短板,MathArena Apex 仅 38.7 分,硬核数学/竞赛题上落后于顶级闭源模型。
  2. 代码能力中上但非顶尖,SWE-Bench Verified 78.0 仍低于 GPT-5.5 的 84.4。
  3. 作为较新的正式版,社区生态、第三方工具适配仍在快速成长中。

七、结语

腾讯混元 Hy3 正式版的发布,标志着国产大模型在"Agent 能力"这条赛道上迈出了关键一步。它用一套精巧的 MoE 架构证明了:强大的模型不一定需要昂贵的推理成本,而完全开源 + 极低定价的策略,也让更多开发者能够真正用起来。

如果你关注智能体、自动化办公、低成本私有化部署,或者只是想找一个好用的国产开源大模型,Hy3 绝对值得上手试一试。

参考来源:腾讯混元官方博客、Hugging Face 模型卡、36 氪 / InfoQ / 腾讯云开发者社区相关报道(2026-07-06 至 2026-07-12)。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐