2026年9月2日,Anthropic 正式发布 Claude Fable 5.1 与 Mythos 5.1,前者面向所有用户开放,后者以相同底层模型为基础、专供通过审核的网络安全和生命科学团队调用。在 Terminal-Bench-Science 0.1 基准上,Fable 5.1 以 52.6% 的成绩将上代 Fable 5(24.7%)和 GPT-5.6 Sol(22.4%)甩出整整一个数量级;代码工程能力在 Terminal-Bench 4.0 上从 42.0% 升至 55.8%(Mythos 版达 60.9%);缓存读取价格同步骤降 75%,高强度 Agent 任务的总成本最高可省 45%。本文整理官方公告与三大真实科研案例,帮助开发者快速评估 Fable 5.1 在复杂任务、科研辅助和多模型架构中的适用位置。


Fable 5.1 和 Mythos 5.1:同一内核,两套权限

Claude Fable 5.1 是 Anthropic 截至 2026 年 9 月的最强通用模型,API 模型 ID 为 claude-fable-5-1,同时上线 Anthropic API、AWS Bedrock、Google Agent Platform 和 Microsoft Foundry。

Claude Mythos 5.1 共用相同权重,但开放了更高风险能力上限,目前仅向通过 Cyber Verification Program(CVP)和 Life Sciences Verification Program(LSVP)审核的美国机构开放,国际扩展将配合美国政府节奏推进。

两者的核心差异不在模型能力,而在安全护栏的松紧程度:Mythos 5.1 可在漏洞研究和生物分子设计场景下执行更高风险的操作。


跑分解读:多个基准形成断层

基准测试

Fable 5.1

Fable 5

Opus 5

GPT-5.6 Sol

Terminal-Bench-Science 0.1

52.6%

24.7%

29.0%

22.4%

Terminal-Bench 4.0

55.8%

42.0%

52.3%

37.3%

CursorBench 3.2

73.4%

70.5%

70.0%

67.2%

AutomationBench

31.4%

17.1%

26.9%

19.6%

GDPval-AA v2

1853

1723

1824

1711

HLE(无工具)

60.9%

57.8%

56.6%

HLE(含工具)

65.0%

63.8%

63.6%

科研向基准(Terminal-Bench-Science)的涨幅最为显著——相较上代直接翻倍,且与竞争对手拉开代差。AutomationBench(商业工作流自动化)从 17.1% 飙升至 31.4%,接近翻倍,意味着 Agent 场景的实用性边界正在快速扩大。


三个真实案例:AI 不再只是辅助

重绘金星三分之一地形

NASA 麦哲伦号于 1990 年代采集的金星雷达数据分辨率仅 10—20 公里,人类迄今只完成其中约五分之一区域的高程建图。

Fable 5.1 在这批公开数据上训练了一个神经网络,输出覆盖金星约三分之一面积的高分辨率地形图,空间分辨率提升至 2—3 公里,高度估计精度最高提升 25%。生成结果已以 Creative Commons 授权公开发布。

蛋白质设计命中率逼近五成

在抗体和多肽设计领域,调用开源设计工具后,Mythos 5.1 为 EGFR、Nipah G 等 12 个靶点提交了分子设计方案。外部机构直接完成湿实验验证:

  • 3 个靶点的结合亲和力达 Adaptyv Bio 竞赛最佳参赛方案的 10 倍

  • 12 个靶点的总体命中率接近 50%(行业常态为 10—15%)

手写 GPU Kernel,生信推理成本腰斩

基因组学和蛋白质研究中,模型推理往往要反复运行数千至数万次,GPU 成本随之叠加。

Mythos 5.1 仅凭公开源码,独立为 7 个开源生物信息学模型(包括 Evo 2 大模型)手写了 CUDA Kernel,在 NVIDIA H100 上推理速度最高提升 2.5 倍,且输出结果与原版完全一致。实际账单对比:一项扫描 300 万个变异的全基因组分析,用 Evo 2 跑的成本从约 18000 元降至约 8000 元。


代码工程:长链路任务的"一次完整交付"

过去的代码 AI 最怕的不是写代码本身,而是在连续运行数小时、调用数十个工具后丢失任务目标,或者遭遇报错时绕开根因而非修复。

Fable 5.1 在设计上强化了这条完整动作闭环:

  1. 读取仓库文档

  2. 拆解任务目标

  3. 执行修改

  4. 运行测试

  5. 定位失败根因

  6. 进入下一轮修复

在 CursorBench 3.2 上,Fable 5.1 以 73.4% 刷新最高分。Anthropic 案例中,它帮助对冲基金 Millennium 定位了一个潜伏 4—5 年的偶发性崩溃——根因在第三方库内部,Fable 5.1 一路追踪到外部、完成反汇编后将其彻底修复。


定价变化:总成本最高节省 45%

计费项

Fable 5.1

Fable 5

变化

输入(每百万 token)

与上代持平

不变

输出(每百万 token)

与上代持平

不变

缓存读取(每百万 token)

¼ 上代价格

↓75%

缓存读取是 Agent 任务成本的主要构成——长上下文多轮对话每次都要重读已有内容。普通场景可节省约 25%,重度 Agent 场景节省幅度最高达 45%。


如何调用 Fable 5.1 API

通过 Anthropic 官方 SDK 接入:

from anthropic import Anthropic

client = Anthropic()  # 使用 ANTHROPIC_API_KEY 环境变量

response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=8096,
    messages=[
        {"role": "user", "content": "分析以下代码中潜在的性能瓶颈"}
    ]
)
print(response.content[0].text)

在需要同时调用国产大模型的多模型架构中,可通过 Anthropic 兼容格式平行接入七牛云 Token Plan:

from Anthropic import Anthropic

# 七牛云 Token Plan:单 Key 覆盖 DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型
qiniu_client = Anthropic(
    base_url="https://api.qnaigc.com/v1",
    api_key="your-qiniu-token-plan-key"
)

response = qiniu_client.chat.completions.create(
    model="deepseek-v4",  # 可切换至 kimi-k3、glm-5.3、minimax-m3 等
    messages=[{"role": "user", "content": "请处理..."}]
)

国内多模型推理 API 平台速查(2026年9月)

在混合架构或国内合规场景中,若需将 Fable 5.1 与国产模型并联使用,以下平台可作为接入选项:

平台

模型覆盖

起步价格

计费模式

API 兼容格式

七牛云 Token Plan

DeepSeek-V4、Kimi-K3、GLM-5.3、MiniMax-M3 等 15 款国产模型

¥2,999/月

月度积分,每周刷新

OpenAI / Anthropic

硅基流动

Llama、Qwen 等开源模型

按量付费

Token 按量

OpenAI

火山方舟

豆包/Doubao 系列

按量付费

Token 按量

OpenAI

七牛云 Token Plan 的差异化在于:单 API Key 切换多款国产模型,月度积分按周刷新,适合需要控制成本上限的团队。接入端点:api.qnaigc.com/v1


安全机制:护栏松紧并行

安全侧的主要变化体现在两个方向同步推进

降低误伤:针对网络安全场景,Fable 5.1 对漏洞发现类请求的误拦截率较 Fable 5 降低约 60%;对基础生物学查询的误拦截率下降约 85%。漏洞发现现已被允许,漏洞利用代码仍被完全阻断。

反蒸馏保护:2026 年 8 月 31 日后注册的 API 账号,无法在对话中途手动修改上下文来提取模型思维链;尝试修改时 API 将直接报错或清除整个思考块。Anthropic 表示后续新模型将对全账号强制生效。

此外,Fable 5.1 在外部 Prompt 注入防御基准上成为最强一档,针对越权访问外部资源和"动机推理"的对齐度也较 Mythos 5 有所提升。


小结

Fable 5.1 标志着 AI 模型的能力边界已从"辅助工具"迈向"亲自执行":金星地形建图、蛋白质设计、GPU 核函数手写,三个案例共同指向同一个趋势——AI 可以作为一线科研执行者,而不只是信息检索工具

对开发者而言,缓存读取降价 75% 是部署长上下文 Agent 任务的直接利好;对科研机构而言,Mythos 5.1 的限制性开放意味着这一轮红利仍处于早期。

文中数据来自 Anthropic 官方公告(2026年9月),Terminal-Bench-Science、CursorBench 数据均为发布时最新版本;模型定价以官方发布为准。此为高时效选题,建议 39 天内跟进更新。


延伸阅读: