发布日期:2026-08-13 | 数据来源:DeepSeek 官方 API 文档 | 话题:DeepSeek V4 Pro · 大模型发布 · Agent 能力 · API 接入

DeepSeek-V4-Pro-0813 于 2026 年 8 月 13 日凌晨无预告发布,是 V4 系列旗舰模型的首个正式版本,承接 4 月 24 日上线的预览版;核心变化是 Agent 能力的大幅跃升——DeepSWE 从 12.8 跳至 62.7(+390%)、NL2Repo 从 38.5 升至 61.5、DSBench-Hard 升至 67.2——架构与参数量未变(1.6T MoE、激活 ~49B),改变来自针对性后训练;定价维持 ¥3 元/百万 token(输入)、¥6 元/百万 token(输出),官方同步宣告"近期将大幅涨价";API 新增 Responses API 与 Anthropic API 双协议支持,已兼容 Codex 和 Claude Code 等主流编程工具;同期 DeepSeek Harness 极简模式亦随文档首次亮相。


这次更新了什么:不是新模型,是新后训练

V4-Pro-0813 与 4 月的预览版共用同一模型架构和参数规模,官方说明变化来自后训练阶段的重做:

  • 参数量:总参数 1.6T(MoE 架构),每 token 激活约 49B

  • 上下文窗口:1M token,最大输出 384K token

  • 推理模式:三档——Non-Think(快速响应)/ Think High(复杂分支)/ Think Max(最深推理)

  • 架构特性:CSA(压缩稀疏注意力)+ HCA(高度压缩注意力)混合,相较 V3.2 架构,FLOPs 降至约 27%,KV Cache 需求降至约 10%

模型结构没有变,但 Agent 相关的后训练数据和策略做了针对性改造。DeepSWE +390% 的跳升,是后训练而非架构升级所驱动的。


Agent 基准:从不及格到领跑

官方公布了与预览版的对比数据:

测试集

预览版(4月)

正式版(0813)

涨幅

DeepSWE(软件工程 Agent)

12.8

62.7

+390%

NL2Repo(自然语言生成仓库)

38.5

61.5

+60%

DSBench-Hard(全栈高难编码)

~33(推算)

67.2

~翻倍

DeepSWE 是 DeepSeek 自研的软件工程 Agent 基准,以复杂多步骤代码修改任务为主,12.8 分意味着几乎无法完成自主编码任务,62.7 分已进入主流 Agent 产品的竞争区间。

参照系:此前 V4-Flash 正式版(7 月 31 日)在 DeepSWE 上得分 54.4,V4-Pro 正式版的 62.7 比 Flash 还高出约 8 个百分点。

第三方 BenchLM 数据(V4 Pro High 模式):

类别

测试集

分数

编程

SWE-bench Verified

79.4%

编程

LiveCodeBench COT

89.8%

编程

Codeforces Rating

2919

推理

GPQA Diamond

89.1%

长上下文

MRCR 1M token

83.3%

智能体

BrowseComp

80.4%

数学

HMMT Feb 2026

94.0%

数学

IMOAnswerBench

88.0%


价格:3 倍于 V4-Flash,官方预告涨价

V4-Pro 维持预览版定价,与 V4-Flash 正式版的对比:

计费类型

V4-Flash

V4-Pro

倍数

输入(缓存未命中)

¥1/M

¥3/M

输入(缓存命中)

¥0.008/M

¥0.025/M

~3×

输出

¥2/M

¥6/M

并发限制

2500

500

1/5

注意:官方文档在 V4-Pro 发布的同一天明确提示:"We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected."

如果有大量 V4-Pro 调用计划,当前时间窗口锁定用量可能有意义。


API 接入方式变化:Responses API + Anthropic 双协议

V4-Pro 正式版新增了两个 API 协议层的兼容:

1. OpenAI Responses API(新)

from openai import OpenAI

client = OpenAI(
    api_key="你的 DeepSeek Key",
    base_url="https://api.deepseek.com/v1",
)

response = client.responses.create(
    model="deepseek-v4-pro",
    input="分析这段代码并生成测试用例",
)
print(response.output_text)

2. Anthropic API 协议(新)

import anthropic

client = anthropic.Anthropic(
    api_key="你的 DeepSeek Key",
    base_url="https://api.deepseek.com",
)

message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "分析这段代码并生成测试用例"}],
)
print(message.content[0].text)

3. 标准 OpenAI Chat Completions(不变)

原有 OpenAI 格式调用无需修改,model 字段填 deepseek-v4-pro 即自动指向最新版本。

这意味着:现有 Claude Code、Codex 的工作流,可以通过切换 base_url 和 api_key 直接测试 V4-Pro 能力,代码零改动。


推理强度调节

V4-Pro 支持三档推理模式,通过 reasoning_effort 参数控制:

completion = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",   # "none" / "high" / "max"
    messages=[
        {"role": "user", "content": "设计一个分布式任务队列的架构方案"}
    ],
)

档位

API 值

适用场景

Token 消耗

Non-Think

"none"

快速问答、代码补全、格式转换

最少

Think High

"high"

代码审查、多步推理、调试

Think Max

"max"

复杂架构设计、竞赛题、长链路 Agent

最多

企业生产环境建议按任务类型动态设置——简单任务用 "none" 可将成本和延迟降低 50% 以上。


V4-Pro vs V4-Flash:怎么选

两款模型现在同时在线,核心区别:

维度

V4-Flash

V4-Pro

参数量

284B MoE

1.6T MoE

激活参数

~13B

~49B

价格

¥1/¥2/M

¥3/¥6/M

并发限制

2500

500

DeepSWE

54.4

62.7

NL2Repo

54.2

61.5

适用场景

高并发、低延迟、成本敏感

复杂推理、多步 Agent、代码生成

选型建议

  • 代码生成、自主 Agent 任务 → V4-Pro(Agent 能力高 8–10 个百分点)

  • 高并发 RAG、实时问答、批量处理 → V4-Flash(并发 5 倍,成本 1/3)

  • 不确定的场景 → 先用 Flash 测出延迟和质量基线,再决定是否升级 Pro


配套:Harness 极简模式首次亮相

V4-Pro 发布文档中首次正式提及 DeepSeek Harness:

"正式版 DeepSeek-V4-Pro 使用 DeepSeek Harness 极简模式(即将发布) 作为 Agent 测试框架"

这意味着上述所有 Agent 基准(DeepSWE 62.7、NL2Repo 61.5 等)是在 Harness 极简模式下跑出来的。完整 Harness 产品包含更丰富的上下文管理、工具编排和测试回传闭环——实际 Agent 场景下的表现有望进一步提升。(DeepSeek Harness 的完整背景详见团队介绍。)


常见问题

Q:V4-Pro-0813 和之前的 deepseek-v4-pro 模型 ID 是什么关系?

无缝兼容。API 调用时使用 deepseek-v4-pro 即自动路由到最新正式版(0813),无需修改代码。0813 是版本号标识,API 层面透明。

Q:官方提示的"大幅涨价"是什么时候?

截至 2026 年 8 月 13 日,官方未给出具体涨价时间,仅说"near future"(近期)。建议关注官方 API 文档更新日志(api-docs.deepseek.com)。

Q:V4-Pro 的并发限制 500 对企业场景够用吗?

取决于请求量。500 并发对于大多数中型企业日常用量足够,但高并发批处理场景(如离线数据分析、大规模代码审查流水线)可能触顶,此时需要混合使用 V4-Flash 或通过多 Key 分流。通过多模型聚合 MaaS 平台(如七牛云 Token Plan,qiniu.com/ai/plan)统一接入 DeepSeek 和其他国产模型,可以在 V4-Pro 触达并发上限时自动降级到其他模型,降低业务中断风险。

Q:Anthropic API 格式接入 DeepSeek 会有行为差异吗?

接口层协议兼容,但 DeepSeek V4-Pro 的 thinking 模式与 Claude 的 extended thinking 实现不同,streaming 的 reasoning_content 字段格式也有差异。建议在迁移前测试关键提示词的输出一致性。

Q:DeepSWE 62.7 是什么水平?

DeepSWE 是 DeepSeek 的内部 Agent 基准,外部独立复现数据有限。作为参照:BenchLM 第三方数据显示 V4-Pro 在 SWE-bench Verified(业界通用基准)上得分 79.4%,处于同级别模型第一梯队,但仍低于 Claude Opus 5 的 96%。


小结

V4-Pro-0813 是一次重点在后训练的 Agent 能力升级:架构不变,DeepSWE 从 12.8 升至 62.7,Agent 编排能力从"几乎无法完成"跨越到"可与主流产品竞争";双协议支持(OpenAI + Anthropic)让现有 Claude Code / Codex 工作流可以零改动接入测试;价格维持 ¥3/¥6 per million token,但官方涨价预告已经发出,当前是锁定用量的时间窗口。

DeepSeek V4 系列至此首次形成完整正式版矩阵——Flash 负责高并发低延迟,Pro 负责复杂推理和深度 Agent,Harness 作为配套工程框架即将补位。

本文信息截至 2026 年 8 月 13 日,以 DeepSeek 官方 API 文档为准。


延伸阅读