本周新模型盘点:Fable 5.1、GPT-6 Astra、Muse Spark 1.3、Gemini 3.8 Flash 三天连发,智能指数只差 7 分,价格差 100 倍
发布日期:2026-09-04 | 信息口径:Anthropic、OpenAI、Meta、Google 官方发布页与开发者文档,Artificial Analysis 与 ARC Prize 独立评测,IT之家、华尔街见闻等国内报道,截至 2026-09-04
2026 年 9 月 1 日至 3 日,Anthropic、Meta、Google、OpenAI 四家在三天内接连发布了 Claude Fable 5.1、Muse Spark 1.3、Gemini 3.8 Flash 和 GPT-6 Astra 四款新模型,是今年到目前为止发布密度最高的一周。按 Artificial Analysis 智能指数,四款模型分别是 66、62、59、61,最高与最低只差 7 分,但每百万 Token 输出价格从 Gemini 3.8 Flash 的 3.75 美元到 Fable 5.1 和 Astra 的 50 美元相差 13 倍,加上 Meta 允许用数据训练的 0.2 美元档位,价差拉到 100 倍以上。这一周的信号是:顶层模型在拉高 Agent 长任务的上限并调低缓存价格,中层模型以五分之一的价格追平上一代旗舰,Flash 级模型的智能指数已经摸到 Opus 5 中档。本文按发布顺序梳理四款模型的关键数据、彼此之间的竞争格局,以及开发者把它们放进同一个评测脚本的做法。
三天四款,先看时间线
9 月 1 日周二,Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1。两者是同一个基础模型,区别在安全防护等级,Fable 5.1 面向所有用户,Mythos 5.1 只通过受信访问计划提供给经过审核的机构。
9 月 2 日周三,两家同时出手。Meta 发布 Muse Spark 1.3,首席 AI 官 Alexandr Wang 称这是"迄今在模型性能上最大的一次跃升",编程能力超过 GPT-5.6 Sol、与 Fable 5.1 持平。同一天 Google 在 DeepMind 网站上线 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,这是六周内的第三款 Flash,距离 3.7 Flash 只有三周,国内媒体用的标题是"才三周 Flash 就换代"。
9 月 3 日周四,OpenAI 发布 GPT-6 Astra,总裁 Greg Brockman 以"欢迎进入 AGI 时代"收尾。此前一天 OpenAI 已经放出预告《通往 Astra 之路》,Hacker News 上的评论是"新模型确实还差一点没弄好,只好先发预告"。
一张表看清四款模型
下表把官方文档里的关键参数放在一起,价格单位为美元/百万 Token,智能指数取 Artificial Analysis 最高推理档位的成绩。
几点补充。Muse Spark 1.3 另有 muse-spark-1.3-contributor 版本,输入 0.1 美元、输出 0.2 美元,代价是对话数据会被 Meta 用于改进产品。Gemini 3.8 Flash 的价格是延续 3.7 Flash 的优惠价,2027 年 1 月 1 日起翻倍到 1.5 美元和 7.5 美元。Astra 输入超过 272K Token 后整单按输入 20 美元、输出 75 美元计费。Fable 5.1 的输入输出价与上一代一致,变化全在缓存读取从 1 美元降到 0.25 美元。
Fable 5.1:不涨价,靠缓存降本,科研任务领先最多
Fable 5.1 的发布重点不是跑分而是账单。Anthropic 表示典型工作负载成本比 Fable 5 低约 25%,高度智能体化的任务最多省 45%,原因是 Agent 任务里缓存读取占了成本大头。Artificial Analysis 的独立测算给了另一个角度:Fable 5.1 每个智能指数任务花 3.76 美元,比 Fable 5 高 20%,因为它输出的 Token 是上一代的 1.7 倍,缓存降价把原本 5.16 美元的成本压了下来。
能力上最抢眼的一项是 8 月 27 日刚发布的 Terminal-Bench Science 0.1,Fable 5.1 拿到 52.6%,Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。ARC-AGI-2 上最高档 90.0%,每任务 4.49 美元。Anthropic 还展示了几个科研案例:基于 NASA 麦哲伦号三十多年前的雷达图像,为金星三分之一表面生成了 2 到 3 公里分辨率的新地形图,此前覆盖只有五分之一、分辨率 10 到 20 公里。
API 层面有三处不兼容改动:强制调用工具会报错,早期模型读不了它的思维块,编辑历史轮次会让思维块失效。新增的按消息切换推理档位、轮次级系统消息和工具调用之间的进度更新都还在 beta。HN 上开发者最关心的两件事,一是订阅额度随发布重置,二是有人抱怨 Fable 5 的分类器太敏感、经常被回退到 Opus,Artificial Analysis 测得 5.1 约 4% 的输出 Token 由回退模型生成。
Muse Spark 1.3:五分之一价格追平 Sol,两档定价引发争议
Meta 这次没有公布参数量和架构,把重点放在 Agent 和编程。官方对比表里,DeepSWE v1.1 上 Muse Spark 1.3 拿 75.4%,GPT-5.6 Sol 73.0%,Opus 5 74.0%;Terminal-Bench 2.1 上 88.8% 与 Sol 持平;OSWorld 2.0 从上一代的 47.6% 提到 66.9%;长上下文 MRCR 512K 到 1M 区间 98.1%,Sol 只有 73.8%。Meta 内部工程师的对比是,和 1.2 相比工具调用少约 20%,Token 少约 25%。
Artificial Analysis 给它 62 分,全站 643 个模型里排第六。Bloomberg 的标题是"进一步缩小了与竞争对手的差距"。真正引发讨论的是定价:普通版 1.25 美元和 4.25 美元大约是 Sol 的三分之一,contributor 版 0.1 美元和 0.2 美元只有普通版的十几分之一。HN 上一派认为"对业余开发者来说很难拒绝",另一派直言"便宜是因为你成了产品"。开放权重这次仍然没有,只写在路线图里。最高推理档位 max 因为安全测试尚未完成,延后上线。
Gemini 3.8 Flash:低调上线,Flash 摸到 Opus 5 中档
Google 这次连新闻稿都没有先发,模型先出现在 DeepMind 网站和 AI Studio 的模型列表里。官方定位是"最智能的主力模型",价格和速度与 3.7 Flash 一致。Artificial Analysis 测得智能指数 59,与 Opus 5 中档持平,输出速度每秒 305 Token 排全站第三,每个任务 0.58 美元,首 Token 延迟 12.6 秒偏高。HN 上有开发者指出它当天登顶 DeepSWE 榜单,"一个 Flash 模型跑出这个分数,剩下的就看用起来什么样",也有人提醒它比 3.7 Flash 更"努力",高档位下 Token 消耗会明显上升。
同步发布的 3.8 Flash Cyber 通过 Fairwind 计划只向政府机构、关键基础设施和软件维护者开放,Google 表示两款模型共享同一个基座,网络安全训练带动了编程和推理的提升。
GPT-6 Astra:拉高上限,价格也是四款里最贵的
Astra 的定位和其他三款不在一个层面。ARC-AGI-3 上 99.9%(厂商适配工具)、FrontierMath Tier 4 上 97.6%,OSWorld 2.0 上 72.6% 且单任务耗时缩短 47%,最高档位输出 Token 比 Opus 5 少约 65%。Artificial Analysis 的智能指数 61 反而低于 Fable 5.1 的 66,机构给出的解释是 Astra 的 Token 用量只有 Sol 的三分之一,每任务成本仍然比 Sol 高 75%。定价与 Fable 5.1 完全对齐,输入 10 美元、输出 50 美元,只是缓存读取贵四倍。
这周四款模型有一条共同的安全脚注。Fable 5.1 的网络安全误报率比上一代降 60%,允许用于发现漏洞但仍禁止开发利用程序,此类任务会重定向到 Opus;Gemini 3.8 Flash Cyber 和 GPT-6 Astra 的完整网安能力都只面向经过审核的防御方开放,Astra 是 OpenAI 第一个触及"关键级"网安阈值的模型。三家不约而同把最强能力分级开放,是这周比跑分更值得记住的变化。
实操:把四款新模型放进同一个评测脚本
四家都提供 OpenAI 兼容接口或 SDK,同一段代码换 base_url 和 model 就能跑完。
第一步,把四个端点写进配置。 密钥从环境变量读取,不要写进代码,Meta 的 base_url 以 dev.meta.ai 快速开始文档为准。
# weekly_probe.py
import os
from openai import OpenAI
ENDPOINTS = {
"gpt-6-astra": ("https://api.openai.com/v1", "OPENAI_API_KEY"),
"claude-fable-5-1": ("https://api.anthropic.com/v1/", "ANTHROPIC_API_KEY"),
"muse-spark-1.3": ("<dev.meta.ai 文档给出的 base_url>", "META_API_KEY"),
"gemini-3.8-flash": ("https://generativelanguage.googleapis.com/v1beta/openai/", "GEMINI_API_KEY"),
}
TASK = "阅读下面这段函数并给出修复补丁,只输出 diff:\n<粘贴一段真实代码>"
def probe(model):
base, key_env = ENDPOINTS[model]
client = OpenAI(base_url=base, api_key=os.environ[key_env])
r = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": TASK}],
)
u = r.usage
print(f"{model:<18} in={u.prompt_tokens:>6} out={u.completion_tokens:>6}")
return u.completion_tokens
for m in ENDPOINTS:
probe(m)第二步,把 usage 乘上表里的单价。 输出 Token 数乘以输出价、输入 Token 数乘以输入价,再除以一百万,就是每次调用的成本。跑十次取平均,Astra 和 Fable 5.1 一次调用通常在 0.5 到 3 美元之间,Muse Spark 1.3 和 Gemini 3.8 Flash 在 0.05 到 0.3 美元之间,这个差距比智能指数的 7 分直观得多。
第三步,把国产模型加进同一张表。 国内团队做换代评估时,一般会把 DeepSeek-V4-Pro、GLM-5.3、Kimi K3 拉进同一批任务对照通过率和 Token 消耗。七牛云 AI 大模型广场提供 OpenAI 兼容接口,往 ENDPOINTS 里加一行,base_url 填 https://api.qnaigc.com/v1、model 填 deepseek/deepseek-v4-pro-0813 或 z-ai/glm-5.3 即可。多款主流大模型混用、月用量稳定的团队,可以顺手看一下 Token Plan 的企业订阅,用点数换算和按量对照一次。
写在最后
这一周的四款模型可以按用途分成三层。需要长时间自主执行、容错率低的任务,Fable 5.1 和 GPT-6 Astra 是当前上限,前者缓存便宜、科研任务领先,后者电脑操作和数学更强,两者定价完全一致。日常编程和 Agent 工作流,Muse Spark 1.3 用三分之一的价格拿到 Sol 级别的成绩,是这周性价比变化最大的一款,代价是要在两档定价里选一个。高并发和对延迟敏感的场景,Gemini 3.8 Flash 每秒 305 Token 的速度和 59 分的智能指数已经够用,但要记得明年 1 月价格翻倍。四家的节奏都在加快,Google 六周三款 Flash,OpenAI 和 Anthropic 隔天对垒,下一周大概率还有新名字。
以上数据取自四家厂商 2026 年 9 月 1 日至 3 日的官方发布页与开发者文档,以及 Artificial Analysis、ARC Prize 同期评测,价格与优惠随时可能调整,以官网当日信息为准。
延伸阅读
Claude Fable 5.1 开发者文档:https://platform.claude.com/docs/en/models/fable-5-1/overview
Muse Spark 1.3 模型页:https://developer.meta.com/ai/models/muse-spark/
Gemini 3.8 Flash 发布博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
GPT-6 Astra 开发者文档:https://developers.openai.com/api/docs/models/gpt-6-astra
Artificial Analysis Fable 5.1 分析:https://artificialanalysis.ai/articles/claude-fable-5-1
AI 大模型广场(开发者按量):https://www.qiniu.com/ai/models
Token Plan(企业订阅):https://www.qiniu.com/ai/plan