发布日期:2026-09-03 | 话题:大模型发布 | 适合:开发者、技术选型决策者

Meta Muse Spark 1.3 是 Meta Superintelligence Labs 于 2026 年 9 月 2 日发布的多模态推理模型,是 Muse Spark 系列在四个月内的第四个版本,主打智能体(Agent)长任务与编程能力。官方公布的核心变化是三条:模型学会在指令模糊时反问、在执行不可逆操作前确认、在卡住时向用户求助;相比 1.2 版本在内部评测中少用约百分之二十的工具调用和约百分之二十五的 token;长上下文检索基准 MRCR 在两个区间分别拿到 98.5 和 98.1 分。基准表现呈现明显的偏科:终端任务与长上下文追平第一梯队,而在 GDPval-AA v2、DeepSearchQA、Agentic IF Index 三项上仍落后于 Opus 5 与 GPT-5.6。定价维持与 1.2 相同的水平,并首次把「贡献数据换低价」做成独立模型 ID,两档价差达到十二倍以上。本文基于官方文档与第三方独立测评,梳理它到底改了什么、值不值得切换。


Muse Spark 1.3 是什么

Muse Spark 1.3 是 Meta 于 2026 年 9 月 2 日发布的闭源多模态推理模型,上下文窗口 100 万 token,支持文本、图像、视频与文档输入,定位是「智能体与编程场景的主力模型」。

它不是一次架构层面的重做,而是 Muse Spark 系列的第三次迭代更新。这条产品线的时间轴很密集:

时间

版本

关键变化

2026-04-08

Muse Spark

系列首发,Meta Superintelligence Labs 出品,100 万上下文

2026-07-09

Muse Spark 1.1

工具使用与计算机操作能力提升,Meta Model API 公测

2026-08-05

Muse Spark 1.2

同步发布终端编程智能体 Muse Code,支持并行子智能体

2026-08-10

Muse Glimmer

300 亿参数开源多模态模型,单张 24GB 消费级显卡可跑

2026-09-02

Muse Spark 1.3

智能体长任务、协作行为、效率三线提升

四个月五次发布,节奏本身就是 Meta 这轮追赶策略的一部分。

1.3 版本具体改了什么

Muse Spark 1.3 的更新重心不在「更聪明」,而在「更好用」——官方博客用的原词是 real-world usability(真实场景可用性)。

Meta 官方列出的五项变化:

  • 长周期任务:能在单个会话线程中持续推进多个工作流,而不是每次都需要重开对话

  • 主动协作:提示词有歧义时会反问澄清;卡住时会主动请用户介入;执行有后果的操作前会先确认

  • 多任务分辨:在混乱的单线程上下文中,能把新提示词正确映射到对应的那个任务上

  • 自我认知校准:被训练成识别自身能力边界与外部障碍,而不是直接编造一个执行结果

  • 安全鲁棒性:对抗性输入与提示词注入抵抗力提升,对「什么算不可逆操作」的判断更准

其中「主动反问」这一条值得单独说。传统模型在提示词模糊时倾向于猜一个最可能的意图直接执行,长任务里这会导致执行几十步之后才发现方向错了。1.3 把澄清行为写进了训练目标,代价是交互轮次可能变多,收益是返工率下降。

Meta 还给了一个用户可调的行为开关:长任务执行期间,模型会根据用户偏好选择「频繁汇报进度」或「后台静默执行」。

基准成绩:领先项与落后项分别在哪

Muse Spark 1.3 的基准表现高度偏科——长上下文与终端任务进入第一梯队,通用智能体与深度搜索仍有明显差距。

基准

Muse Spark 1.3

对比参照

结论

MRCR 256K–512K

98.5

对比组最高

领先

MRCR 512K–1M

98.1

对比组最高

领先

Terminal-Bench 2.1

88.8

GPT-5.6 持平

追平

DeepSWE v1.1

75.4

编程强项

SWEAtlas CodeBase QnA

59.4

编程强项

OSWorld 2.0

66.9

计算机操作

JobBench

64.9

职业任务

AutomationBench

49.4

自动化

GDPval-AA v2

1754

Opus 5 为 1824

落后

DeepSearchQA

89.4

GPT-5.6 为 93.0

落后

Agentic IF Index

57.8

GPT-5.6 为 60.5

落后

数据来源:Investing.com 2026 年 9 月 2 日报道,与 Meta 官方评测方法报告口径一致。

第三方独立评测给出的位置更直观:Artificial Analysis 智能指数 v4.1.1 给 Muse Spark 1.3(max 模式)打了 62 分,在 636 个受测模型中排名第 6,而该指数所有模型的中位数是 17 分。

换句话说,Muse Spark 1.3 稳定进入了全球前十,但没有在任何一项通用智能体基准上拿到第一。

官方说少用 25% token,第三方数据却给了个反例

这是本次发布里最值得注意的一处口径分歧:Meta 官方宣称 1.3 比 1.2 少用约百分之二十五的 token,而 Artificial Analysis 测出它在整套智能指数评测中生成了 1.2 亿输出 token,冗长度排名第 139 位,同侪中位数是 7200 万。

两个数字并不矛盾,但衡量的是不同东西:

  • Meta 的口径:同一批工程任务下,1.3 与 1.2 的横向对比,统计的是完成任务所需的对话 token 与工具调用次数,减少约百分之二十和百分之二十五

  • Artificial Analysis 的口径:跨模型横向对比,统计的是跑完整套评测集的总输出量,其中包含推理模型的思维链 token

结论是:相比自己的上一代,1.3 确实变简洁了;但相比同价位段的其他推理模型,它的思考链条依然偏长。

这对成本预估有实际影响。如果按「输出 token 更少所以更便宜」来做预算,实际账单可能高于预期——真正的变量是思维链长度,而不是最终回复长度。

定价结构:两个模型 ID 的十二倍价差

Muse Spark 1.3 在 Meta Model API 上提供两个模型 ID,价格差异来自「数据是否用于改进产品」,而非能力差异。

模型 ID

输入(每百万 token)

缓存输入

输出(每百万 token)

数据用途

muse-spark-1.3-contributor

0.10 美元

0.002 美元

0.20 美元

用于改进 Meta 产品

muse-spark-1.3

1.25 美元

0.15 美元

4.25 美元

不用于改进产品

标准版价格与 Muse Spark 1.2 完全一致,Meta AI 负责人 Alexandr Wang 将这一定价形容为「aggressive(激进)」。

贡献者版本的价差非常极端:输入便宜 12.5 倍,输出便宜 21.25 倍,缓存输入便宜 75 倍。这实际上是把「用数据换算力」明码标价了。

选择建议按数据敏感度分两类:

  • 可选贡献者版:开源项目、公开文档处理、个人实验、教学演示、基准测试

  • 必须用标准版:企业内部代码库、客户数据、未公开产品信息、任何有保密义务的内容

需要注意,缓存输入的两档价差最大(0.002 对 0.15 美元),意味着长系统提示词反复调用的场景下,两个版本的实际成本差距会比标称价差更大。

对于需要同时评估多个模型接入成本的团队,按额度包预付的形式可以在调用前就把用量上限固定下来,七牛云 Token Plan 采用的就是这类计费方式,适合预算需要提前锁定的场景。

如何调用 Muse Spark 1.3

Meta Model API 兼容 OpenAI SDK 协议,已有 OpenAI 客户端代码只需替换 base URL、API Key 和模型名即可切换。

第一步,注册并获取 API Key:访问 dev.meta.ai 完成注册,在控制台创建密钥。

第二步,安装 Muse Code 命令行工具(macOS / Linux):

curl -fsSL https://dev.meta.ai/install.sh | bash

第三步,用 OpenAI 兼容客户端调用模型:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_META_API_KEY",
    base_url="<Meta Model API base URL,见 dev.meta.ai/docs>",
)

resp = client.chat.completions.create(
    model="muse-spark-1.3",          # 或 muse-spark-1.3-contributor
    messages=[
        {"role": "user", "content": "分析这个代码库的模块依赖关系"}
    ],
)
print(resp.choices[0].message.content)

需要实时网络信息时,Meta 提供了搜索接地(search grounding)工具,在请求中挂载一个工具即可,无需自建检索管线。

注意两点限制:max 推理模式在发布日尚未开放,官方说明是安全测试未完成;官方文档页未直接公布 base URL,需要在 dev.meta.ai/docs 中查取。

竞争格局:Meta 站在什么位置

Muse Spark 1.3 让 Meta 在 2026 年 9 月的前沿模型竞争中稳住了第一梯队末位,但尚未在任何主赛道上取得领先。

从三个维度看这个位置:

  • 能力维度:全球第 6,编程与长上下文接近顶尖,通用智能体落后 Opus 5 与 GPT-5.6 一档

  • 价格维度:标准版定价与主流前沿模型同区间,贡献者版在同等能力段几乎没有对手

  • 生态维度:拥有 Muse Code 终端智能体、开源的 Muse Glimmer、以及即将到来的 Muse Spark 开源权重版本

这一周三家竞品同时发布新模型,Meta 选择在 9 月 2 日跟进,本身说明了节奏压力。

更值得关注的是路线图信号。Meta 明确了两件事:一是继续做更大的模型,二是会发布 Muse Spark 的开源权重版本。Zuckerberg 表示开源权重版本将在「近期」推出。如果这一步落地,Meta 就同时占住了闭源前沿和开源权重两个位置——这正是 Llama 时代它最擅长的打法。

Alexandr Wang 向媒体表示,这次更新是在为「个人智能体(personal agent)」这类即将到来的产品铺路。结合 1.3 版本主推的长周期任务与主动协作能力,方向已经比较清楚:模型能力更新是为消费级智能体产品做准备,而不只是为了刷榜。

什么情况下值得切换

是否从 1.2 或其他模型切换到 Muse Spark 1.3,取决于任务形态而非基准分数本身。

建议切换的场景:

  • 单会话内需要连续推进数小时的长任务,反复重开对话成本高

  • 超长上下文检索需求,尤其是 25 万至 100 万 token 区间(MRCR 双项第一)

  • 终端环境下的自动化操作(Terminal-Bench 2.1 已追平 GPT-5.6)

  • 数据不敏感且预算受限,贡献者版的价格优势难以拒绝

不建议急于切换的场景:

  • 深度搜索与信息聚合为主的应用(DeepSearchQA 落后 3.6 分)

  • 对智能体指令遵循精度要求极高的生产链路(Agentic IF Index 落后 2.7 分)

  • 依赖 max 推理模式的重推理任务,该模式发布日尚未开放

  • 已在现有模型上做过大量提示词调优,切换需要重新校准反问行为带来的交互变化

一个务实做法是:先用贡献者版在非敏感任务上跑两周真实负载,拿到自己的成本与成功率数据,再决定是否把生产流量迁到标准版。基准分数只能筛掉明显不合适的选项,不能替代自己的场景验证。

常见问题

问:Muse Spark 1.3 开源吗?

当前发布的 1.3 是闭源模型,仅通过 Meta Model API 和 Muse Code 提供。Meta 官方博客在路线图中明确提到会有「Muse Spark 开源权重发布」,但未给出具体版本号和时间。已开源的是 2026 年 8 月 10 日发布的 Muse Glimmer,300 亿参数多模态模型。

问:contributor 版本和标准版本的能力有区别吗?

官方页面上两者的差异描述只有数据用途一项:contributor 版「用于改进我们的产品」,标准版「不用于改进我们的产品」。上下文窗口同为 100 万 token。官方未说明二者在模型权重或推理配置上是否存在差异,能力是否完全等同建议自行测试验证。

问:max 推理模式什么时候能用?

Meta 官方说明是「安全测试完成后不久推出」,未给出具体日期。发布日(2026 年 9 月 2 日)当天,常规推理模式已全量可用,max 模式尚未开放。Artificial Analysis 给出的 62 分智能指数正是基于 max 模式测得,因此常规模式的实际表现应低于该分数。

问:Muse Spark 1.3 和 Muse Code 是什么关系?

Muse Code 是 Meta 于 2026 年 8 月 5 日推出的终端编程智能体,Muse Spark 是驱动它的底层模型。1.3 发布当天已在 Muse Code 中上线,现有 Muse Code 用户无需更换工具即可用上新模型。二者的关系类似编程智能体与其后端模型。

问:100 万上下文窗口实际能装多少内容?

按 Artificial Analysis 的换算,100 万 token 约等于 1500 页 A4 文档。MRCR 基准测的正是这个区间的检索准确率,1.3 在 25 万至 50 万区间得 98.5 分、50 万至 100 万区间得 98.1 分,意味着上下文拉满时的召回衰减很小,这是它目前最扎实的一项能力。

小结

Muse Spark 1.3 是一次典型的「补短板」发布:Meta 没有在通用智能体基准上超车,但把长上下文和终端任务两项做到了第一梯队,同时用 contributor 版本的极端定价撬开了价格敏感型开发者市场。

判断这次发布价值的关键,不在于 62 分的智能指数排名第 6,而在于三条可验证的事实:MRCR 双项 98 分以上的长上下文能力、与 GPT-5.6 持平的 Terminal-Bench 2.1 成绩、以及输入端便宜 12.5 倍的贡献者定价。这三条决定了它在什么场景下是最优解。

本文数据截至 2026 年 9 月 3 日,来源为 Meta AI Research 官方博客、Meta 开发者文档、Artificial Analysis 独立评测(智能指数 v4.1.1)及 Investing.com 报道。模型基准成绩与定价可能随版本更新变动,接入前请以 dev.meta.ai 官方文档为准。

延伸阅读