发布日期:2026-09-03 | 话题标签:Gemini 3.8 Flash、Gemini 3.8 Flash Cyber、Google DeepMind、DeepSWE、Agent 编程模型、模型选型

Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的 Flash 系列最新模型,距 3.7 Flash 上线仅三周,是六周内的第三款 Flash,官方定位为"面向长周期软件工程、自主 Agent 与复杂企业工作流的最智能 Flash 模型",模型 ID 为 gemini-3.8-flash,1,048,576 token 上下文、65,536 token 最大输出,支持文本、图像、视频、音频与 PDF 输入。它沿用 3.7 Flash 的首发价:每百万 token 输入 0.75 美元、输出 3.75 美元,该价格到 2026 年 12 月 31 日截止,2027 年 1 月 1 日起翻倍为 1.5 美元与 7.5 美元。能力上的核心变化是"投入更多计算完成任务":在 DeepSWE v1.1 长周期软件工程榜单上以 74% 的 Pass@1 与 Claude Opus 5 并列第一,单任务成本 2.36 美元约为 Opus 5 的五分之一;HLE-Verified 得 54.9%;Artificial Analysis 智能指数 59、输出速度 302 token/s 排同类第三。同期发布的 Gemini 3.8 Flash Cyber 面向安全防御,仅通过 Fairwind Program 向政府、关键基础设施与核心软件维护方开放。本文基于官方博文、定价页、模型卡与第三方榜单,梳理这次发布改变了什么、竞争格局如何变化、开发者该怎么选。


Gemini 3.8 Flash 是什么

Gemini 3.8 Flash 是 Google 当前最强的 Flash 系列模型,与 3.7 Flash 保持相同速度与价格,主要提升推理与代码能力,重点是软件工程、Agent 任务和专业领域多步推理。

模型卡关键参数(ai.google.dev,2026 年 9 月 2 日更新):

项目

模型 ID

gemini-3.8-flash(稳定版同名)

上下文窗口

1,048,576 token

最大输出

65,536 token

输入模态

文本、图像、视频、音频、PDF

输出模态

文本

思考等级

low / medium / high,不支持 minimal(传入会报错)

支持功能

函数调用、上下文缓存、Batch API、搜索接地、代码执行、文件搜索、结构化输出、URL 上下文、Flex 与 Priority 推理;计算机操作为预览

不支持

音频生成、图像生成、Live API

发布节奏值得单独记一笔:3.6 Flash 于 7 月下旬发布,3.7 Flash 于 8 月 14 日发布,3.8 Flash 于 9 月 2 日发布。Google 官方博文自己的表述是"六周内第三款 Flash",3.7 Flash 将继续获得支持,用于更强调效率的工作负载。


这次提升的代价:"更努力"意味着更多 token

Gemini 3.8 Flash 性能提升的核心设计选择是投入更多计算:执行更多推理步骤、反复调用工具,因此在高思考等级下会消耗比 3.7 Flash 更多的 token。

Google 博文原话是模型会"work harder"。DeepSWE 榜单的数据印证了这一点:

模型

Pass@1

单任务成本

输出 token

步数

Gemini 3.8 Flash [high]

74% ± 1%

2.36 美元

14.3 万

166

Gemini 3.7 Flash [high]

65% ± 2%

2.18 美元

10.7 万

125

同样的单价,3.8 Flash 多用了约 34% 的输出 token 和 33% 的步数,换来 9 个百分点的通过率。这意味着两件事:

  • 按任务算,3.8 Flash 只贵 8%,通过率却高得多,长周期编程任务应当直接切换

  • 按 token 算,账单会涨。如果业务是短对话、分类、抽取这类计算效率优先的场景,官方建议用较低思考等级,或者留在 3.7 Flash

HN 讨论中一位用户(Simon Willison)的实测也给出了同样方向的信号:同一测试提示词在 3.8 Flash high 等级下花费 8.97 美分,3.7 Flash 为 8.44 美分,并认为 3.8 的 low 等级相比 3.7 有退步。这类单点观察不构成结论,但与官方"更多计算"的说法一致。


定价:首发价不变,2027 年翻倍

Gemini 3.8 Flash 的首发定价与 3.7 Flash、3.6 Flash 完全一致,四个计费档位如下(每百万 token):

档位

输入

输出(含思考 token)

缓存读取

2027 年 1 月 1 日起

Standard

0.75 美元

3.75 美元

0.075 美元

1.5 / 7.5 / 0.15 美元

Batch / Flex

0.375 美元

1.875 美元

0.0375 美元

0.75 / 3.75 / 0.075 美元

Priority

1.35 美元

6.75 美元

0.135 美元

2.7 / 13.5 / 0.27 美元

补充规则:

  • 思考 token 按输出价计费,没有单独的思考费率

  • 缓存存储每百万 token 每小时 0.5 美元,2027 年起 1 美元

  • 免费层:Standard 与 Priority 档输入输出免费(有限额,内容用于产品改进),Batch 与 Flex 不提供免费层

  • 搜索接地每月 5,000 次免费,Gemini 3.x 系列共享,超出每千次 14 美元

对比同期竞品的按量价格(各官网,每百万 token 输出):Claude Opus 5 在 DeepSWE 上单任务 11.84 美元;GLM-5.3 海外站 4.4 美元;DeepSeek V4 Pro 非高峰 1.98 美元。3.8 Flash 的 3.75 美元处在"国产旗舰之上、海外旗舰之下"的位置,2027 年涨到 7.5 美元后这个位置会明显上移。2026 年底前是价格窗口期,与 3.7 Flash 发布时的判断相同。


竞争格局:Flash 打平旗舰,国产模型紧追

DeepSWE v1.1 是目前最能反映"长周期 Agent 编程"能力的公开榜单,2026 年 9 月 2 日更新后的前 12 名如下(113 个任务,Pass@1,各模型取最佳思考等级):

排名

模型

Pass@1

单任务成本

1

Gemini 3.8 Flash [high]

74% ± 1%

2.36 美元

2

Claude Opus 5 [max]

74% ± 4%

11.84 美元

3

GPT-5.6 Sol [max]

73% ± 3%

6.46 美元

4

Claude Fable 5 [max]

70% ± 4%

21.63 美元

5

GLM-5.3 [max]

69% ± 3%

3.99 美元

6

Kimi K3 [max]

69% ± 5%

4.65 美元

7

GPT-5.6 Luna [max]

67% ± 4%

0.61 美元

8

GPT-5.5 [xhigh]

67% ± 6%

7.23 美元

9

Grok 4.6 [xhigh]

67% ± 2%

5.5 美元

10

Gemini 3.7 Flash [high]

65% ± 2%

2.18 美元

11

GLM-5.3-Flash

63% ± 4%

0.24 美元

12

DeepSeek V4 Pro

63% ± 6%

1.67 美元

榜单自己的提醒必须带上:多个模型分数相同、置信区间大幅重叠,簇内的先后顺序没有统计意义。但三个结论是稳的:

  1. "Flash"不再是小模型的代名词。3.8 Flash 与 Opus 5 同分,成本是后者的五分之一。HN 上有评论直接说 Google 的 Flash "相当于别家的 Pro 或旗舰",命名反而低估了它。Artificial Analysis 智能指数 59 与 Opus 5 medium 等级持平。

  2. 国产开源模型的差距在 5 个百分点以内。GLM-5.3 69%、Kimi K3 69%,成本分别为 3.99 与 4.65 美元;GLM-5.3-Flash 以 0.24 美元拿到 63%,是榜单上性价比最高的一档。DeepSeek V4 Pro 63%、1.67 美元。

  3. Google 的短板仍在工具链而非模型。HN 讨论中被回复最多的批评之一是 Gemini CLI 与 Claude Code、Codex 的差距,以及 Gemini 网页端模型列表更新滞后(发布当天下拉菜单仍只有 3.6 Flash)。模型能力领先与开发者体验落后并存,是 Google 此轮发布的真实处境。

Google DeepMind 成员姚顺宇在发布时的表述是"对模型而言只是一小步,对递归自我改进(RSI)而言是一大步",官方博文也提到两个版本"通过长期运行的 Agent 循环机制进一步增强"。这与 DeepSWE 上 3.8 Flash 用 166 步、14.3 万 token 完成任务的行为特征吻合:它被训练成愿意跑更长的循环。


Gemini 3.8 Flash Cyber:面向防御方的受限版本

Gemini 3.8 Flash Cyber 与 3.8 Flash 共享同一套底层能力,针对安全防御场景训练,不公开发布,只通过 Fairwind Program 向经审核的机构开放。

官方给出的数据点:

  • 内部安全缺陷发现基准覆盖 20 种编程语言,成功率超过 70%

  • CWE-Bench(Collinear 运行)补丁修复 Pass@1 为 47.2%,领先前沿模型为 47.8%,成本显著更低

  • Chrome 安全团队:正确修复补丁数量是更大商业模型的 2.6 倍

  • Wiz:内部渗透测试基准召回率提升 7.5% 到 9.7%,成本降低 2.3 到 5.2 倍

  • Google 云安全研究团队:不到 2 小时定位一个以往需数月的基础性缺陷

Fairwind Program 的准入条件(deepmind.google/fairwind-program):面向政府与国家网络安全机构、关键基础设施运营方(医疗、电信、能源、金融)、核心技术平台,以及做防御性基准研究的学术实验室;申请机构需通过背景审查,使用限于内部安全、应急响应与授权测试团队,要求用户级认证与防钓鱼多因素认证,禁止共享或转售访问权限。官方称已有超过 650 家合作方。

Google 强调研发时"优先提升修复能力而非进攻性能力",Cyber 版本因放宽了部分安全缓解措施才限制在可信防御方内。对普通开发者,这个版本不可用,也不影响 3.8 Flash 的正常使用。


开发者怎么接入,怎么选

Gemini 3.8 Flash 已面向开发者、企业与消费者全面开放,开发者入口是 Gemini API(Google AI Studio)、Antigravity、Android Studio 与 Stitch。

接入要点

  1. 模型 ID 直接写 gemini-3.8-flash,稳定版同名,无需 preview 后缀

  2. 思考等级只能选 low / medium / high,老代码里的 minimal 会报错

  3. 长任务优先用 Batch 或 Flex 档,价格是 Standard 的一半

  4. 系统提示词长的应用务必开上下文缓存,缓存读取只有输入价的十分之一

选型建议

场景

建议

长周期编程 Agent、多步工具调用

切到 3.8 Flash high,按任务算成本只涨 8%

短对话、分类、抽取、高 QPS

留在 3.7 Flash 或 3.8 Flash low,避免思考 token 膨胀

预算敏感且可接受 63% 档位

GLM-5.3-Flash 单任务 0.24 美元,是 3.8 Flash 的十分之一

需要国内直接访问、多模型冗余

Gemini 系列在国内需通过 Google Cloud 或海外聚合平台访问;国产模型侧可用七牛云 Token Plan 一类的多模型统一接入,把 GLM-5.3、Kimi K3、DeepSeek V4 Pro 放进同一个 Key 做对照与回退

消费者侧:Google AI Pro 与 Ultra 订阅用户可在 Gemini 应用、搜索 AI Mode 与 Google Sheets 中使用;企业用户通过 Gemini Enterprise。


常见问题

Q:Gemini 3.8 Flash 和 3.7 Flash 该用哪个? 长周期编程与 Agent 任务用 3.8 Flash,DeepSWE 通过率 74% 对 65%,单任务成本只多 8%。短任务、高并发、计算效率优先的场景留在 3.7 Flash,或用 3.8 Flash 的 low 等级。3.7 Flash 官方承诺继续支持。

Q:为什么说 3.8 Flash 是"Flash 打旗舰"? DeepSWE v1.1 上它与 Claude Opus 5 同为 74%,单任务 2.36 美元对 11.84 美元;Artificial Analysis 智能指数 59 与 Opus 5 medium 持平,输出速度 302 token/s 排同类第三。价格是 Flash,成绩是旗舰。

Q:2027 年涨价影响多大? 输入从 0.75 涨到 1.5 美元,输出从 3.75 涨到 7.5 美元,全档位翻倍。以 DeepSWE 单任务 2.36 美元计,2027 年同样任务约 4.7 美元,仍低于 Opus 5 当前的 11.84 美元,但与 GLM-5.3 的 3.99 美元、Kimi K3 的 4.65 美元拉平。

Q:Gemini 3.8 Flash Cyber 普通开发者能用吗? 不能。仅通过 Fairwind Program 向政府机构、关键基础设施运营方、核心软件维护方和防御性研究实验室开放,需背景审查,禁止转售。普通用户可用公开模型加 CodeMender 做代码安全修复。

Q:Gemini 3.8 Flash 的知识截止日期是什么? 模型卡未标注,只写"最近更新 2026 年 9 月"。[数据待核实:以 deepmind.google 的完整模型卡为准]


总结

Gemini 3.8 Flash 的意义不在参数或价格,而在它把"Flash 价格、旗舰成绩"从口号变成了榜单事实:DeepSWE 与 Opus 5 同分、成本五分之一。代价是模型会跑更长的循环、烧更多 token,短任务用户需要主动降等级或留在 3.7 Flash。竞争格局上,国产模型 GLM-5.3、Kimi K3 落后 5 个百分点但成本相近,GLM-5.3-Flash 以十分之一成本拿到 63%,多模型组合的空间比单选一家更大。2026 年底前的首发价是窗口期,2027 年翻倍后 3.8 Flash 与国产旗舰将处在同一价位带。

据 Google 官方博文,3.8 Flash 是"迄今最好的推理与编程模型,速度与低成本与 3.7 相同";据 DeepSWE 榜单说明,簇内排名因置信区间重叠不具统计意义。本文基于 2026 年 9 月 2 日至 3 日的官方博文、定价页、模型卡、Fairwind 页面、Artificial Analysis 与 DeepSWE 数据,模型迭代节奏为三周一次,建议持续核对。


参考资料