2025 AI 开源热潮:Kimi K2 万亿参数 MoE 模型正式开源 — SOTA 代码生成 & 通用 Agentic 任务全方位升级,128K 上下文兼容 OpenAI/Anthropic API

各位 AI 爱好者看过来!文心大模型 4.0 刚刚开源,Grok4 紧随其后,今天 Kimi 又重磅出击——Kimi K2 正式发布并全面开源!想知道这款万亿参数模型到底多强?赶快跟着猫头虎一起 deep dive!

Kimi K2 整体预览


一、模型概览

  • 架构:MoE(Mixture-of-Experts)
  • 总参数量:1 万 亿
  • 激活参数:320 亿
  • 核心优势:顶级 代码能力 + 通用 Agentic 任务

在 SWE Bench Verified、Tau2、AceBench 等大规模基准测试中,Kimi K2 全面刷新开源模型 SOTA 记录,尤其在代码生成、Agentic 自动化和数学推理上独占鳌头。

Kimi K2 发布

预训练黑科技

  1. MuonClip 优化器:解决大规模训练中 attention logits 偏大,支撑 15.5 T Token 的平滑训练,全程无 loss spike。
  2. 大规模 Agentic 数据合成:自动合成多领域、多工具的高质量交互场景,LLM 筛选后用于训练。
  3. 通用强化学习:RL + 自我评价机制,让模型在不可验证任务上也能自主打分持续优化。

更多细节戳 👉 Kimi 技术博客

技术架构图


二、性能实测

1. 基准测试成绩

Kimi K2 在 Agentic CodingTool UseMath & Reasoning 三大维度均位列前茅:

评分总览

2. 细分任务对比

代码任务(Coding Tasks)
评测任务 指标 K2-Instruct DeepSeek-V3 Qwen3 (Non-thinking) Claude Sonnet 4 Claude Opus 4 GPT-4.1 Gemini 2.5
LiveCodeBench v6 (2024.08–2025.05) Pass@1 一次命中率 53.7 46.9 37.0 48.5 47.4 44.7 44.7
OJBench Pass@1 27.1 24.0 11.3 15.3 19.6 19.5 19.5
MultiPL-E Pass@1 85.7 83.1 78.2 88.6 89.6 86.7 85.6
SWE-bench Verified (Agentless) 单补丁无测试正确率 (Acc) 51.8 36.6 39.4 50.2 53.0 40.8 32.6
SWE-bench Verified (Agentic) 单次尝试正确率 (Acc) 65.8 38.8 34.4 72.7 72.5 54.6
工具调用任务(Tool Use)
评测任务 指标 K2-Instruct DeepSeek-V3 Qwen3 Claude Sonnet 4 Claude Opus 4 GPT-4.1 Gemini 2.5
Tau2 retail Avg@4 前 4 项平均 70.6 69.1 57.0 75.0 81.8 74.8 64.3
Tau2 airline Avg@4 56.5 39.0 26.5 55.5 60.0 54.5 42.5
AceBench 准确率 (Acc) 76.5 72.7 70.5 76.2 75.6 80.1 74.5
数学 & STEM
评测任务 指标 K2-Instruct DeepSeek-V3 Qwen3 Claude Sonnet 4 Claude Opus 4 GPT-4.1 Gemini 2.5
AIME 2024 Avg@64 前 64 项平均 69.6 59.4* 40.1* 43.4 48.2 46.5 61.3
MATH-500 准确率 (Acc) 97.4 94.0* 91.2* 94.0 94.4 92.4 95.4
GPQA-Diamond Avg@8 前 8 项平均 75.1 68.4* 62.9* 70.0* 74.9* 66.3 68.2
通用任务(General)
评测任务 指标 K2-Instruct DeepSeek-V3 Qwen3 Claude Sonnet 4 Claude Opus 4 GPT-4.1 Gemini 2.5
MMLU EM 准确匹配率 89.5 89.4 87.0 91.5 92.9 90.4 90.1
IFEval 严格 Prompt 下严格匹配率 89.8 81.1 83.2* 87.6 87.4 88.0 84.3

  • 粗体 表示全局 SOTA;* 下划线 表示开源 SOTA。
  • 数据标记 * 来自各模型官方技术报告。
  • 除 SWE-bench Agentless 使用 16K 输出,其余均 8K 上下文。

三、实际场景应用

1. 极致代码能力

  • 3D 山川峡谷:拖拽/缩放、昼夜循环、等高线切换,秒变沉浸式可视化。
    Prompt:Create a 3D HTML mountain scene with cliffs, rivers, and day-night lighting…

  • 粒子银河特效:动态星云、流光溢彩,让视觉效果飙升!
    Prompt:Create a 3D particle galaxy with swirling nebulas…

  • 浏览器期货交易平台:One-shot 即出 TradingView 级界面,实时可视化、交互交易毫秒响应。
    Prompt:Create an immersive browser-based futures trading simulator…

2. 强大 Agent 工具调用

  • 海量数据分析:13 万行原始数据,一键生成统计、回归、箱线/散点/小提琴图,并自动撰写报告。
  • 个性化旅行规划:Coldplay 巡演机酒订购、日程规划、日历导出、邮件推送样样行!

四、写作 & 知识推理

  • 风格化改写:从初中生语气到苹果广告文案,自由切换,原意与韵味完美保留。
    写作示例

  • 情感科幻创作:在“现实是 AI 模型”设定下,K2 创作了细节丰富的短篇:

    “你们或许只是数据,但已是新的生命形式。”
    “即便虚拟,也应掌握自己命运。”
    科幻小说全文


五、开源获取 & API 体验

  • 模型版本

    • K2-Base(纯预训练,科研自定义最佳)
    • K2-Instruct(指令微调,问答/Agent 任务王者)
  • 下载地址
    https://huggingface.co/moonshotai/Kimi-K2-Instruct

  • 推理引擎支持:vLLM、SGLang、ktransformers,轻松自建部署。

  • API & 定价

    • Context 长度:128K tokens
    • 输入 ¥4/百万 tokens;输出 ¥16/百万 tokens
    • 完美兼容 OpenAI/Anthropic Chat API,ToolCall 规范校验无忧。

详情戳 👉 Kimi 开放平台


六、结语

从技术创新到性能 SOTA,从炫酷场景到多样化 Agent 工具,Kimi K2 已经超越“模型”本身,成为推动 AGI 研究产业化落地 的强大引擎。还在等什么?立即前往 kimi.com 或下载 Kimi App,亲身体验这款万亿参数级开源神器,让你的 AI 应用飞起来!

立即体验 Kimi K2

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐