Meta 发布 Muse Spark 1.2 与 Muse Code:百万 token 上下文的终端编程 Agent
8月5日,Meta 发布了编程专用语言模型 Muse Spark 1.2 和终端编程 Agent Muse Code(beta)。这是 Meta 首次推出面向开发者的完整编程 Agent 方案,直接对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。
两个产品,一次发布
Muse Spark 1.2 是 Meta 专为编程场景训练的语言模型,支持100万 token 的上下文窗口——足以把一个大型项目的依赖图、历史代码和数千个文件装进同一次会话。Muse Code 则是基于这个模型的终端 Agent,目前以 beta 形式面向 macOS 和 Linux 用户开放。
值得注意的是,这两个产品是联合训练的:Muse Code 被纳入了 Muse Spark 1.2 的训练流程,让模型在工具调用和计划执行方面更贴合实际编程场景。同时,模型也在多种编程 Agent 环境中训练过,不局限于 Muse Code 本身。更有意思的是,上一代 Muse Spark 1.1 生成的训练数据被用来训练 1.2——相当于一次自我改进循环。
Muse Code 的核心能力
Muse Code 不是一个代码补全工具,而是一个能独立完成多步骤开发任务的 Agent:
- 并行子 Agent + 隔离 Git worktree:面对大型项目,Muse Code 可以自动把任务拆分给多个子 Agent,每个子 Agent 在独立的 Git worktree 中工作,互不干扰,也不会影响开发者的主工作目录。据报道,扎克伯格曾亲自用它同时开发一个游戏的六个功能。
- 异步后台 Agent:一组后台 Agent 在整个会话中保持活跃,避免重复检索和不必要的等待。
- 事件日志运行时:每次模型调用、工具执行和代码编辑都记录到只追加的 JSONL 日志中。如果会话崩溃,用
muse resume就能从断点恢复,不丢失任何上下文。 - 内置技能:
/plan把任务转化为需要确认的计划,/grill对计划做压力测试,/taste做界面设计审查,/goal让 Agent 聚焦于既定目标。这些技能只在开发者主动调用时才执行。
定价与可用性
Muse Spark 1.2 通过 Meta Model API 提供两种访问层级:
- contributor 层级:按5小时滚动窗口的 token 用量限速(而非按请求次数),但使用数据可能被用于改进 Meta 产品。
- standard 层级:定价为 $0.15/百万 cached input token、$1.25/百万 input token、$4.25/百万 output token。
模型也可通过 OpenRouter 访问。Meta 已开始接受零数据保留(zero-data-retention)的请求。需要注意的是,模型权重不开放下载,只能在 Meta 服务器上运行。
安装 Muse Code 只需一行命令:
```
curl -fsSL https://dev.meta.ai/install.sh | bash
```
Windows 用户目前需要通过 WSL 使用。
性能表现
Meta 在三个 benchmark 上测试了 Muse Spark 1.2:Terminal Bench 2.1(89个任务)、DeepSWE v1.1(113个任务,覆盖5种编程语言)和 Meta 内部编程基准(440个真实 PR 任务)。不过 Meta 目前只发布了柱状图,没有公布精确数值。
一个更有说服力的案例是24小时 GPU kernel 优化:模型在超过1000次工具调用中,持续优化 NVIDIA Hopper 架构的内核代码,展示了长时间自主工作的能力。
编程 Agent 赛道的新格局
Muse Code 的发布意味着编程 Agent 赛道又多了一个重量级玩家。Claude Code 已经积累了大量用户,OpenAI 的 Codex 也在持续迭代,Meta 的差异化在于:百万 token 上下文、并行子 Agent 架构、以及相对较低的 API 定价。对于需要在大型代码库中做跨文件重构、长时间调试的开发者来说,这些特性有实际价值。
不过目前 Muse Code 仍处于 beta 阶段,模型不开源,Windows 原生支持也还没到位。想要尝试的开发者可以先在非关键项目上试用,观察其在实际工作流中的表现。