一、Persistent background agents + 并行 worktree:不是新概念,拼起来是新武器

Muse Code 这次下注最重的架构选择,Meta 自己把它叫做”async background agents”。

市面上绝大多数竞品 harness 的做法是:每来一个新任务,就新 spawn 一批辅助 agent。Muse Code 反过来——一组专门的”后台 agent”在整个 session 期间一直活着。Meta 官方博客的原话是:这些 agent”在整个 session 期间持续激活,而不是为单个任务 spawn 出来,这能避免重复的信息搜集”,自己推进下一步,自己挑时机回报主 agent。

这套设计卖的是”少等 + 少盯”:一个已经认识这个仓库的 agent,不需要在每次开发者提新需求时重新摸一遍地形。

任务规模够大时,Muse Code 会把工作扇出到并行的子 agent——每个子 agent 跑在各自隔离的 git worktree 里,开发者本地的工作副本完全不会被碰到。Zuckerberg 在 X 上很得意地讲了一个内部测试案例:

“在测试里,我们让它同时给一个游戏搭 6 个特性,没撞车。”

worktree 隔离 + 并行子 agent,这些在竞品里都有。但 Meta 这次的差异点,是把”持久化”和”并行”这两件事拼在一起卖

第二个值得专门说的设计选择,是可审计性(auditability):每一条模型调用、每一次 tool 运行、每一次审批、每一次编辑,在执行之前就先被追加到一份本地 event log——Meta 把这个 runtime 称为 “replay-exact and restart-safe”。

这意味着,如果 Muse Code 在一个跑了几十小时的长任务里崩溃,重启之后它会精确从断点继续,既不丢活、也不需要重新 prompt。对那些被”黑盒 agent 跑”烧怕了的工程负责人来说,一份完整的本地审计轨迹,可能恰恰是它在企业评估里被记住的那个 feature。

Muse Code 还内置了一套对手工具用户看着眼熟的 “skills”:

  • /plan — 把任务转成一份带审批门的方案
  • /grill — 把这份方案反复拷问,直到它扛得住
  • /goal — 把 agent 推向某个明确目标的完成态

二、Muse Spark 1.2:和它自己的 harness 一起训练出来的

往下一层,是 Muse Spark 1.2——Meta 把这个版本定位为 Muse Spark 1.1 的”编码专修”,在编码任务上显著放大了训练算力,同时让训练环境更多样化,目标是”在维持通用 agentic 能力的同时,提升代码生成、复杂调试、代码库理解”。这次更新,正好打在 Muse 家族最弱的那块板上

四月份 Muse Spark 初登场时,Meta 一度把自己推回 frontier reasoning / vision 榜单前五——但在最贴合这个市场的 agentic 编码评测上,跑分明显落后:SWE-Bench Verified 上 77.4,对比 Claude Opus 4.6 的 80.8、Gemini 3.1 Pro 的 80.6,更别提 GPT-5.4 在衡量长时任务(work tasks)的 GDPval 上还压得更深。

四个月后,一个”编码专精”checkpoint + 一套为它定制的 harness,读起来就是 Meta 对这个差距的直接回应。

训练细节里有两个值得拎出来说:

  1. 模型和 Muse Code 联合训练。Meta 用 rejection-sampled harness 轨迹 + 针对目标、context 压缩、子 agent 的”配方优化”来调模型——意思是:模型被显式调过,就是为了在这套工具里跑得最好。这件事折射的是整个行业的一个转向:模型和 harness 不再被当成两件可以分开卖的产品。
  2. 自改进循环。Muse Spark 1.1 自己去生成”有挑战的编码环境”和”复杂指令模板”,再用这些要求去打分候选解,得到一份可扩展的训练数据集给后继版本用。Meta 把这个循环归功为 1.2 在”跟住复杂指令”上确实能测出更强的主要原因。

Meta 这次公布了一组对比图,把 Muse Spark 1.2 放在 Terminal-Bench 2.1、DeepSWE 1.1、Meta 自家内部编码基准上和别家打——但指向了一份单独的方法学报告让读者去翻细节。整段公告里没有自吹自擂,在一个大家都在抢着发榜单截图的行业里,这种克制本身就不寻常。图能解释为什么:三张图都显示了一个共同的结果——稳居第二、距离第一有清晰差距

原文图 3 — Muse Spark 1.2 benchmark 对比图。Credit: Mark Zuckerberg / Meta。

具体数字:

  • Terminal-Bench 2.1:Muse Spark 1.2 跑在 Muse Code 里,拿 82.9%,压过 OpenAI 的 GPT-5.6 Terra(在 Codex 里,81.8%)和 xAI 的 Grok 4.5(在 Grok Build 里,81.6%),但追不上 Anthropic Opus 5 以 max effort 跑在 Claude Code 里的 86.7%
  • DeepSWE 1.1:Muse Spark 1.2 拿 59.3%,排在第三,前面是 Opus 5(65.0%)和 GPT-5.6 Terra(64.8%)。
  • 最值得玩味的是 Meta 自家内部编码基准:Muse Spark 1.2 的 70.6% 稳压 GPT-5.6 Terra(65.4%)和 Gemini 3.6 Flash(63.9%),但仍然比 Opus 5 的 79.4% 落后近 9 个点。在 Meta 自己设计的测试上 Anthropic 还是赢——这个承认相当坦白。三个榜单,Claude 全都登顶。

代际进步是真的:Muse Spark 1.2 在 Terminal-Bench 上比 1.1 高 6.7 点,DeepSWE 高 6.3 点。但图注里藏了一个关键 caveat:1.1 的分数是当时跑在通用 mini-swe-agent harness 上测的,1.2 是跑在 Muse Code 上测的——所以 6.7 里有相当一部分属于”新 harness 的功劳”,不能全算在”新模型”头上。

最能撑场面的 demo,Meta 选了一个长时任务:把 Muse Spark 1.2 扔去做 GPU kernel 优化,让它在 NVIDIA Hopper 硬件上跑超过 1000 次 tool 调用、最长 24 小时

约束条件很硬:用 Triton 写,禁止直接包现成的第三方 kernel 库。Agent 一路写、编、profile,最后在 KDA 和 MLA kernel 的基线实现上拿到 Meta 口中”大幅”的提升——其中甚至包含真正非显然的优化,比如把 gated cumulative decay 重新对齐到 chunk 中点。

“它一直能在初轮探索之后很久,继续找到重大改进,“Zuckerberg 写道。

如果这件事在 Meta demo 之外也能复现,它就正面回应了过去几年对编码 agent 最顽固的批评——过了最初的爆发期就进入平台期或开始漂移


三、用你的数据换 1 折价——这次最该被反复看的就是定价

这次发布里,定价很可能是分量最重、也最该被反复抠的部分。Meta 把 Muse Spark 1.2 通过 Meta Model API 拆成两层卖。

标准档(standard tier):输入 1.25 / 百万 token**,输出 **4.25 / 百万 token,缓存输入 0.15/百万token∗∗;Meta承诺这一档的prompt和completions∗∗不会∗∗被用来训练自家模型。没有长上下文溢价;ratelimit是∗∗每团队每分钟3000次请求、4Mtoken∗∗。在主流API模型里,∗∗价格属于中游∗∗。∗∗贡献档(contributortier)∗∗:输入∗∗0.10 / 百万 token,输出 0.20 / 百万 token**——分别比标准档**便宜约 12 倍和 21 倍**;缓存输入**近乎免费**的 **0.002 / 百万 token。代价是:你显式授权 Meta 用你的 prompt 和 completions 去训练未来的模型这是当前市面上最便宜的一档——但你付的不是钱,是数据(下文详述)。

下面是 VB 整理出来的 32 行价格对照表,完整镜像原文:

  • Terminal-Bench 2.1:Muse Spark 1.2 跑在 Muse Code 里,拿 82.9%,压过 OpenAI 的 GPT-5.6 Terra(在 Codex 里,81.8%)和 xAI 的 Grok 4.5(在 Grok Build 里,81.6%),但追不上 Anthropic Opus 5 以 max effort 跑在 Claude Code 里的 86.7%
  • DeepSWE 1.1:Muse Spark 1.2 拿 59.3%,排在第三,前面是 Opus 5(65.0%)和 GPT-5.6 Terra(64.8%)。
  • 最值得玩味的是 Meta 自家内部编码基准:Muse Spark 1.2 的 70.6% 稳压 GPT-5.6 Terra(65.4%)和 Gemini 3.6 Flash(63.9%),但仍然比 Opus 5 的 79.4% 落后近 9 个点。在 Meta 自己设计的测试上 Anthropic 还是赢——这个承认相当坦白。三个榜单,Claude 全都登顶。

代际进步是真的:Muse Spark 1.2 在 Terminal-Bench 上比 1.1 高 6.7 点,DeepSWE 高 6.3 点。但图注里藏了一个关键 caveat:1.1 的分数是当时跑在通用 mini-swe-agent harness 上测的,1.2 是跑在 Muse Code 上测的——所以 6.7 里有相当一部分属于”新 harness 的功劳”,不能全算在”新模型”头上。

最能撑场面的 demo,Meta 选了一个长时任务:把 Muse Spark 1.2 扔去做 GPU kernel 优化,让它在 NVIDIA Hopper 硬件上跑超过 1000 次 tool 调用、最长 24 小时

约束条件很硬:用 Triton 写,禁止直接包现成的第三方 kernel 库。Agent 一路写、编、profile,最后在 KDA 和 MLA kernel 的基线实现上拿到 Meta 口中”大幅”的提升——其中甚至包含真正非显然的优化,比如把 gated cumulative decay 重新对齐到 chunk 中点。

“它一直能在初轮探索之后很久,继续找到重大改进,“Zuckerberg 写道。

如果这件事在 Meta demo 之外也能复现,它就正面回应了过去几年对编码 agent 最顽固的批评——过了最初的爆发期就进入平台期或开始漂移


三、用你的数据换 1 折价——这次最该被反复看的就是定价

这次发布里,定价很可能是分量最重、也最该被反复抠的部分。Meta 把 Muse Spark 1.2 通过 Meta Model API 拆成两层卖。

标准档(standard tier):输入 1.25 / 百万 token**,输出 **4.25 / 百万 token,缓存输入 0.15 / 百万 token**;Meta 承诺这一档的 prompt 和 completions **不会**被用来训练自家模型。没有长上下文溢价;rate limit 是**每团队每分钟 3000 次请求、4M token**。在主流 API 模型里,**价格属于中游**。 **贡献档(contributor tier)**:输入 **0.10 / 百万 token,输出 0.20 / 百万 token**——分别比标准档**便宜约 12 倍和 21 倍**;缓存输入**近乎免费**的 **0.002 / 百万 token。代价是:你显式授权 Meta 用你的 prompt 和 completions 去训练未来的模型这是当前市面上最便宜的一档——但你付的不是钱,是数据(下文详述)。

下面是 VB 整理出来的 32 行价格对照表,完整镜像原文(Muse Spark 系列行的官方定价:

Model                              Input  Output   Total  Source
---------------------------------------------------------------------
Muse Spark 1.2 Contributor         $0.10   $0.20   $0.30  Meta
MiMo-V2.5 Flash                    $0.10   $0.30   $0.40  Xiaomi
deepseek-v4-flash                  $0.14   $0.28   $0.42  DeepSeek
deepseek-v4-pro                   $0.435   $0.87  $1.305  DeepSeek
GPT-5.6 Luna                       $0.20   $1.20   $1.40  OpenAI
MiniMax-M3                         $0.30   $1.20   $1.50  MiniMax
LongCat-2.0 - limited-time promo   $0.30   $1.20   $1.50  LongCat
Gemini 3.1 Flash-Lite              $0.25   $1.50   $1.75  Google
MiMo-V2.5                          $0.40   $2.00   $2.40  Xiaomi
Gemini 3.5 Flash-Lite              $0.30   $2.50   $2.80  Google
LongCat-2.0 - standard             $0.75   $2.95   $3.70  LongCat
MiMo-V2.5 Pro (<=256K)             $1.00   $3.00   $4.00  Xiaomi
Muse Spark 1.1 / 1.2               $1.25   $4.25   $5.50  Meta
GLM-5.2                            $1.40   $4.40   $5.80  Z.ai
Grok 4.5                           $2.00   $6.00   $8.00  xAI
MiMo-V2.5 Pro (>256K)              $2.00   $6.00   $8.00  Xiaomi
Qwen3.8-Max                        $2.00   $6.00   $8.00  QwenCloud
Gemini 3.6 Flash                   $1.50   $7.50   $9.00  Google
Gemini 3.5 Flash                   $1.50   $9.00  $10.50  Google
Gemini 3.1 Pro Preview (<=200K)    $2.00  $12.00  $14.00  Google
GPT-5.6 Terra                      $2.00  $12.00  $14.00  OpenAI
GPT-5.4                            $2.50  $15.00  $17.50  OpenAI
Kimi K3                            $3.00  $15.00  $18.00  Moonshot AI
Gemini 3.1 Pro Preview (>200K)     $4.00  $18.00  $22.00  Google
Claude Opus 5                      $5.00  $25.00  $30.00  Anthropic
GPT-5.5                            $5.00  $30.00  $35.00  OpenAI
GPT-5.5 Instant (chat-latest)      $5.00  $30.00  $35.00  OpenAI
Sakana Fugu Ultra (<=272K)         $5.00  $30.00  $35.00  Sakana AI
GPT-5.6 Sol - Standard mode        $5.00  $30.00  $35.00  OpenAI
Claude Fable 5 / Claude Mythos 5  $10.00  $50.00  $60.00  Anthropic
GPT-5.6 Sol - Fast mode           $10.00  $60.00  $70.00  OpenAI

这一档就是 Zuckerberg 把新用户往里塞的那档:

“上手门槛低、成本低,“他写道,“一条命令装上 Muse Code,你就能从我们的 contributor tier 开始。”

VentureBeat 自己在 Mac mini 上跑了一次:那条一行安装脚本确实如广告所说——97 MB 下载 + 登录——但 agent 没真正跑起来,提示”看不到任何模型”以及”需要先完成支付方式才能用完设置”。换句话说:哪怕是被打到骨折的 contributor tier,你也得先在 Meta 这边挂一张支付方式,agent 才会动说它便宜是对的,但”免费”是错的。

Meta 把 contributor tier 框定为——当”让 Meta 拿你的数据去训练”可接受时,用来降低原型和试验的门槛

但这同时意味着:Muse Code 的默认入口会把开发者的代码和 prompt 灌进 Meta 的训练管线——手上有专有代码库的企业,必须显式 opt out、升到标准档才能避开这件事。

contributor tier 的 rate limit 也比标准档紧得多——每分钟 60 次请求 vs 3000 次——这个数字本身就在喊:这一档是给个人和小型实验用的,不是给生产负载用的

这条路是教科书式的 Meta 玩法:补贴入口、批量收割数据、用数据去拉近和 frontier 的差距。Zuckerberg 自己也没藏野心,把 Muse Spark 1.2 称为”我们朝 frontier 推进的下一站,更大、更强的模型在路上”。

但对那些因为合规义务、必须把代码锁住的开发者和企业来说,这个交换,未必是他们愿意、也未必是他们能做的


四、视野里没有 Llama——这次最显眼的缺席,反而是开源

今天的发布最显眼的缺席,是”open source”这个词从头到尾没出现——而这家公司花了三年把自己定位成开源 AI 的旗手

从 2023 年 2 月初代 LLaMA 亮相(权重几周内就泄露到 4chan,意外点燃了”在消费级硬件上跑得动像样模型”这场运动),到 Llama 2 的可商用许可、到编码专精的 Code Llama、再到 2024 年 7 月 Zuckerberg 推出 405B 参数的 Llama 3.1,并配了一篇宣言《Open Source AI Is the Path Forward》——Meta 给开发者讲的所有故事,核心都只有一句:前沿级权重应该免费下载、自托管、微调

这套打法起效了:到 2026 年初,Llama 家族累计下载量约 12 亿次,日均约 100 万次;企业自托管对比专有 API,VentureBeat 此前报道过最高可省 88%

然后是翻车Llama 4 2025 年 4 月登场,评价参半,最后承认基准测试结果有水分;同期中国开源权重对手——DeepSeek、Alibaba、Zhipu AI——到 2025 年末在 Hugging Face 的下载量占比冲到 41%,把 Llama 在这场它自己开启的运动里的”领导者”叙事直接侵蚀掉了。这次踉跄直接催生了 Zuckerberg 在 2025 年夏对 Meta AI 业务的大改组——成立 Meta Superintelligence Labs(MSL),并把 Scale AI 联合创始人 Alexandr Wang 拉来当 chief AI officer

Llama 时代实质上在今年 4 月 8 日结束——那天 MSL 推出了初代 Muse Spark,Wang 的原话是”meta 推出过的最强模型”,云端独占、无可下载权重、不可自托管、最初只面向 Meta 自家 App 和私有 API 预览。VentureBeat 当时直接问 Meta:未来 Llama 还做不做?得到的回答是”我们现有的 Llama 模型会继续以开源形式提供”——对”未来的版本”刻意没表态

Wang 自己也说”更大的模型已经在做,会开源后续版本”——但四个月过去,这次发布:没有权重,没有 license,博客和 Zuck 推文里甚至连 “open” 这个词都没出现一次

反转的力度,正因为 Meta 的对手们正在朝反方向走。OpenAI 把 Codex CLI 用宽松、企业友好的 Apache 2.0 开源,随后还发了 gpt-oss 开源权重模型;Google 的 Gemini CLI harness 也是 Apache 许可。

Muse Code 让 Meta 落到了最像 Anthropic 的位置——Claude Code 至今仍是专有——而这家曾经主张”开源是路”的公司,现在要求开发者按 token 付费买一个他们自己都看不到内部的模型,或者用自家数据补贴这个入口

从这个角度看,contributor tier 本质上就是 Llama 策略的接班人:生态飞轮不再是”免费权重换心智”,而是”廉价 token 换训练数据”

但 Zuck 在 X 上那条回复——AI 开发者 Luckey Farady 直接问”Will Muse Code be open source?“——他回的是”I’ll have more to share on that soon”——总归给”Meta 还会不会回到开源 AI 这场球赛里”留了一线希望


五、Why it matters——终端编码 agent 赛道的”两匹马”格局被打破

终端编码 agent 已经是企业 AI 里增长最快的界面;而直到今天,这一品类事实上一直是一场 Anthropic 和 OpenAI 之间的两匹马赛跑,Google 和一群初创公司跟在后面追。

Meta 的入场,带来的是三件别人没有的东西:

  • 一套架构上确实不同的 harness——持久后台 agent + 只追加的本地 event log
  • 一份站得住脚的长时任务 demo——24 小时、1000+ tool 调用的 GPU kernel 优化
  • 一枚激进的价格楔子——contributor tier 把单位 token 成本砍到原来的 1⁄12 ~ 1⁄21

剩下的问题,是基准图答不了的那些:Muse Spark 1.2 在真实仓库上是不是真能匹敌 Claude / GPT 级别模型?开发者愿不愿意把代码交给 Meta?contributor tier 的折扣够不够让他们不再追问这件事? Muse Code 今天起 beta;Muse Spark 1.2 已在 Meta Model API 全面上线。

https://venturebeat.com/orchestration/meta-enters-the-ai-coding-wars-with-muse-spark-1-2-and-muse-code-with-persistent-async-background-agents

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐