发布日期:2026-08-05 | 数据来源:OpenRouter 周度统计(2026 年 7 月 28 日–8 月 3 日)

DeepSeek V4 Flash 是深度求索(DeepSeek)于 2026 年 7 月 31 日正式开放 API 的推理模型,采用 MoE 架构(284B 总参数、推理激活约 13B),定价低至 0.2 元/百万 Token(缓存命中),发布后四天即以单周 7.22 万亿 Token 的调用量登顶 OpenRouter 全球大模型周榜,同期单日峰值在 OpenCode 平台达到 8 万亿 Token,超过 OpenRouter 全平台日均总量;中国模型本周包揽全球 TOP3,连续 14 周调用量超越美国,前十名中占九席,标志着大模型竞争的核心维度已从参数规模切换到成本效率;对开发者而言,V4 Flash 目前是高频调用和 Agent 场景的性价比首选,其与旗舰模型分级路由的组合可将综合 Token 成本降低 40%–60%,而 OpenAI 被迫将 Luna 降价约 80% 的事实,说明这种成本压力已开始重塑整个行业定价基线。

 

DeepSeek V4 Flash 于 2026 年 7 月 31 日正式开放 API,8 月 3 日即以单周 7.22 万亿 Token 的调用量登顶 OpenRouter 全球大模型周榜,耗时不足四天。同期 OpenCode 平台单日处理了 8 万亿 Token,超过 OpenRouter 全平台日均总量,其中 5 万亿来自免费试用、3 万亿来自付费商用,这个数字背后是全球开发者用实际调用投出的一票。本文拆解三个最值得关注的信号:为什么是 Flash 而不是 Pro?中国模型连续 14 周领跑意味着什么?以及这波趋势对开发者选模型、控成本有什么直接影响。

 

四天登顶,数字有多离谱

先把这组数字铺开来看。

根据 OpenRouter 本周(7 月 28 日–8 月 3 日)数据,全球大模型总调用量为 56.8 万亿 Token,同期排行榜前三如下:

排名

模型

周调用量

🥇 1

DeepSeek V4 Flash

7.22 万亿 Token

🥈 2

小米 MiMo-V2.5

6.3 万亿 Token

🥉 3

腾讯 Hy3

4.82 万亿 Token

注意 V4 Flash 是 7 月 31 日才开放的,统计周期包含发布前三天的空白——也就是说它实际跑了四天拿下了这个第一。

更夸张的是单日数字。8 月 1 日,V4 Flash 在 OpenCode(海外开发者开源编程平台)一天处理了 8 万亿 Token,这个量级超过了聚合 400 多款模型的 OpenRouter 全平台日均总量(约 6.6 万亿)。单款模型,单一入口,一天。

这不是刷榜,是开发者真实的生产环境请求。

 

信号一:为什么是 Flash,不是 Pro

DeepSeek V4 Flash 采用 MoE(混合专家)架构,总参数 284B,但推理时仅激活约 13B。这个设计直接决定了它的成本结构——

 输入:0.2 元 / 百万 Token(缓存命中时)

 输出:2 元 / 百万 Token

对比同期主流模型的单任务平均成本:Kimi K3 约 86 美分、GPT-5.6 Sol 约 1.86 美元、Claude Fable 5 约 3.15 美元。V4 Flash 的成本不足 Claude Fable 5 的 1%。

这个价格差距在 Agent 场景下被几何级放大。一个 Agent 任务往往触发数十次模型调用,用旗舰模型跑一次工作流的费用,用 V4 Flash 可以跑几百次。开发者的算盘很清楚。

V4 Pro 和 V4 Flash 并非替代关系,而是场景分工:复杂推理、长链 CoT 上 Pro,高频调用、Agent 编排、成本敏感场景选 Flash。本周 OpenRouter 数据也印证了这一点——V4 Pro 以 3.1 万亿 Token 位居第四,说明两款模型在同时承接不同需求。

能力侧也没有明显短板。在 Agent 终极测试中 V4 Flash 得分 25.2 分,Claude Opus-4.8 为 25.7 分;Terminal Bench 2.1 得分 82.7;智能指数 50 分,与 Gemini 3.6 Flash 持平——这是一款能力接近旗舰、价格打到地板的模型。

 

信号二:中国模型连续 14 周领跑说明了什么

本周前三全是中国模型,TOP 10 中有 9 席来自中国,中国模型总调用量达 28.13 万亿 Token,已连续 14 周超过美国。

这个数字的意义不是"谁赢了",而是竞争维度已经切换

两年前大家比的是参数量,现在比的是价格和实际可用性。OpenAI 这周把 Luna 降价约 80%,但开发者社区的反应是"我们要的是 DeepSeek 的价格"——降到这个价格还不够,因为 V4 Flash 在同等成本下能跑同等甚至更好的效果。

这种压力从 API 市场开始,会逐步传导到整个 AI 应用层的成本预期。用 Agent 跑自动化工作流的团队,现在的假设前提不再是"模型调用很贵,能少就少",而是"模型调用可以随意调,瓶颈在工程侧"。这个心态转变对产品设计的影响比任何单个 benchmark 都大。

 

信号三:开发者真正在用它做什么

OpenCode 平台的 8 万亿 Token 单日数据给出了线索——是编程场景。Agent 时代的编程助手不只是补全代码,而是"思考-搜索-执行-验证"的完整循环,每一轮都在消耗 Token。

V4 Flash 的低延迟特性在流式输出场景里也有明显优势,开发者反馈首 Token 延迟(TTFT)相比旗舰模型有显著改善,这在实时对话和 Agent 中间层场景里直接影响用户体验。

7 月 31 日正式版开放后,社区反馈最集中的是两点:一是基准分数相比预览版大幅提升(Agent 终极测试从 15.8 跳到 25.2),二是 API 稳定性明显好于预览期。前者解释了为什么调用量在发布后几乎垂直拉升,后者说明愿意把生产流量切过来的团队在增加。

 

对开发者的实际影响

如果你在选模型:V4 Flash 目前是高频调用场景的默认起点,性价比已无竞品。对于需要多厂商备份或混合使用(Flash 跑高频、Pro/旗舰模型跑复杂任务)的场景,接入一个统一聚合平台比维护多个 API Key 更省事。七牛云 AI 的模型广场已上线 DeepSeek V4 Flash,通过单一 API Key 兼容 OpenAI 格式调用,无需改动已有代码,Token Plan 企业套餐并发限制低,适合把 V4 Flash 大量跑进生产工作流的团队。

如果你在控成本:Flash + 缓存命中(0.2 元/百万 Token)是目前成本最低的主流调用链路。按四步预算流程(estimate → reserve → usage → reconcile)管理 Token 消耗,结合模型分级路由,复杂任务留给旗舰、重复高频任务全用 Flash,实测综合成本可以降 40%–60%。

如果你在做 Agent:MoE 架构的低激活参数决定了 V4 Flash 在多轮调用下的延迟更稳定,配合七牛云 MCP 服务的云端密钥托管,可以快速搭起多工具 Agent 编排层而不用在本地暴露各服务凭证。

 

一个值得关注的细节

这次登榜的是 V4 Flash 0423版(7.22 万亿),而 0731 正式版在发布后单日即冲到 1.02 万亿 Token,已超越 0423 版日均。下周数据里,正式版的总量大概率会把 0423 版的历史调用量远远甩在后面。

也就是说这个"全球第一"还在提速。

OpenRouter 是目前全球最大的 AI 聚合平台,汇聚了来自全球 400+ 款模型,其周度数据是目前覆盖最广的第三方中立榜单之一。DeepSeek 在这个榜单上连续多周领跑,远不是单次冲榜,而是持续放量的趋势。

 

延伸阅读

 七牛云 AI 模型广场(含 DeepSeek V4 Flash):https://www.qiniu.com/ai/models

 七牛云 Token Plan 企业套餐:https://www.qiniu.com/ai/plan

 OpenRouter 实时周榜:https://openrouter.ai/rankings