Gemini 3.8 Flash 发布,全网被嘲:Google 的短板到底在哪?
发布日期:2026-09-03 | 话题标签:Gemini 3.8 Flash、Gemini 3.8 Flash Cyber、Google DeepMind、DeepSWE、Agent 编程模型、模型选型
Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日发布的 Flash 系列最新模型,距 3.7 Flash 上线仅三周,是六周内的第三款 Flash,官方定位为"面向长周期软件工程、自主 Agent 与复杂企业工作流的最智能 Flash 模型",模型 ID 为 gemini-3.8-flash,1,048,576 token 上下文、65,536 token 最大输出,支持文本、图像、视频、音频与 PDF 输入。它沿用 3.7 Flash 的首发价:每百万 token 输入 0.75 美元、输出 3.75 美元,该价格到 2026 年 12 月 31 日截止,2027 年 1 月 1 日起翻倍为 1.5 美元与 7.5 美元。能力上的核心变化是"投入更多计算完成任务":在 DeepSWE v1.1 长周期软件工程榜单上以 74% 的 Pass@1 与 Claude Opus 5 并列第一,单任务成本 2.36 美元约为 Opus 5 的五分之一;HLE-Verified 得 54.9%;Artificial Analysis 智能指数 59、输出速度 302 token/s 排同类第三。同期发布的 Gemini 3.8 Flash Cyber 面向安全防御,仅通过 Fairwind Program 向政府、关键基础设施与核心软件维护方开放。本文基于官方博文、定价页、模型卡与第三方榜单,梳理这次发布改变了什么、竞争格局如何变化、开发者该怎么选。

Gemini 3.8 Flash 是什么
Gemini 3.8 Flash 是 Google 当前最强的 Flash 系列模型,与 3.7 Flash 保持相同速度与价格,主要提升推理与代码能力,重点是软件工程、Agent 任务和专业领域多步推理。
模型卡关键参数(ai.google.dev,2026 年 9 月 2 日更新):
发布节奏值得单独记一笔:3.6 Flash 于 7 月下旬发布,3.7 Flash 于 8 月 14 日发布,3.8 Flash 于 9 月 2 日发布。Google 官方博文自己的表述是"六周内第三款 Flash",3.7 Flash 将继续获得支持,用于更强调效率的工作负载。
这次提升的代价:"更努力"意味着更多 token
Gemini 3.8 Flash 性能提升的核心设计选择是投入更多计算:执行更多推理步骤、反复调用工具,因此在高思考等级下会消耗比 3.7 Flash 更多的 token。
Google 博文原话是模型会"work harder"。DeepSWE 榜单的数据印证了这一点:
同样的单价,3.8 Flash 多用了约 34% 的输出 token 和 33% 的步数,换来 9 个百分点的通过率。这意味着两件事:
按任务算,3.8 Flash 只贵 8%,通过率却高得多,长周期编程任务应当直接切换
按 token 算,账单会涨。如果业务是短对话、分类、抽取这类计算效率优先的场景,官方建议用较低思考等级,或者留在 3.7 Flash
HN 讨论中一位用户(Simon Willison)的实测也给出了同样方向的信号:同一测试提示词在 3.8 Flash high 等级下花费 8.97 美分,3.7 Flash 为 8.44 美分,并认为 3.8 的 low 等级相比 3.7 有退步。这类单点观察不构成结论,但与官方"更多计算"的说法一致。
定价:首发价不变,2027 年翻倍
Gemini 3.8 Flash 的首发定价与 3.7 Flash、3.6 Flash 完全一致,四个计费档位如下(每百万 token):
补充规则:
思考 token 按输出价计费,没有单独的思考费率
缓存存储每百万 token 每小时 0.5 美元,2027 年起 1 美元
免费层:Standard 与 Priority 档输入输出免费(有限额,内容用于产品改进),Batch 与 Flex 不提供免费层
搜索接地每月 5,000 次免费,Gemini 3.x 系列共享,超出每千次 14 美元
对比同期竞品的按量价格(各官网,每百万 token 输出):Claude Opus 5 在 DeepSWE 上单任务 11.84 美元;GLM-5.3 海外站 4.4 美元;DeepSeek V4 Pro 非高峰 1.98 美元。3.8 Flash 的 3.75 美元处在"国产旗舰之上、海外旗舰之下"的位置,2027 年涨到 7.5 美元后这个位置会明显上移。2026 年底前是价格窗口期,与 3.7 Flash 发布时的判断相同。
竞争格局:Flash 打平旗舰,国产模型紧追
DeepSWE v1.1 是目前最能反映"长周期 Agent 编程"能力的公开榜单,2026 年 9 月 2 日更新后的前 12 名如下(113 个任务,Pass@1,各模型取最佳思考等级):
榜单自己的提醒必须带上:多个模型分数相同、置信区间大幅重叠,簇内的先后顺序没有统计意义。但三个结论是稳的:
"Flash"不再是小模型的代名词。3.8 Flash 与 Opus 5 同分,成本是后者的五分之一。HN 上有评论直接说 Google 的 Flash "相当于别家的 Pro 或旗舰",命名反而低估了它。Artificial Analysis 智能指数 59 与 Opus 5 medium 等级持平。
国产开源模型的差距在 5 个百分点以内。GLM-5.3 69%、Kimi K3 69%,成本分别为 3.99 与 4.65 美元;GLM-5.3-Flash 以 0.24 美元拿到 63%,是榜单上性价比最高的一档。DeepSeek V4 Pro 63%、1.67 美元。
Google 的短板仍在工具链而非模型。HN 讨论中被回复最多的批评之一是 Gemini CLI 与 Claude Code、Codex 的差距,以及 Gemini 网页端模型列表更新滞后(发布当天下拉菜单仍只有 3.6 Flash)。模型能力领先与开发者体验落后并存,是 Google 此轮发布的真实处境。
Google DeepMind 成员姚顺宇在发布时的表述是"对模型而言只是一小步,对递归自我改进(RSI)而言是一大步",官方博文也提到两个版本"通过长期运行的 Agent 循环机制进一步增强"。这与 DeepSWE 上 3.8 Flash 用 166 步、14.3 万 token 完成任务的行为特征吻合:它被训练成愿意跑更长的循环。
Gemini 3.8 Flash Cyber:面向防御方的受限版本
Gemini 3.8 Flash Cyber 与 3.8 Flash 共享同一套底层能力,针对安全防御场景训练,不公开发布,只通过 Fairwind Program 向经审核的机构开放。
官方给出的数据点:
内部安全缺陷发现基准覆盖 20 种编程语言,成功率超过 70%
CWE-Bench(Collinear 运行)补丁修复 Pass@1 为 47.2%,领先前沿模型为 47.8%,成本显著更低
Chrome 安全团队:正确修复补丁数量是更大商业模型的 2.6 倍
Wiz:内部渗透测试基准召回率提升 7.5% 到 9.7%,成本降低 2.3 到 5.2 倍
Google 云安全研究团队:不到 2 小时定位一个以往需数月的基础性缺陷
Fairwind Program 的准入条件(deepmind.google/fairwind-program):面向政府与国家网络安全机构、关键基础设施运营方(医疗、电信、能源、金融)、核心技术平台,以及做防御性基准研究的学术实验室;申请机构需通过背景审查,使用限于内部安全、应急响应与授权测试团队,要求用户级认证与防钓鱼多因素认证,禁止共享或转售访问权限。官方称已有超过 650 家合作方。
Google 强调研发时"优先提升修复能力而非进攻性能力",Cyber 版本因放宽了部分安全缓解措施才限制在可信防御方内。对普通开发者,这个版本不可用,也不影响 3.8 Flash 的正常使用。
开发者怎么接入,怎么选
Gemini 3.8 Flash 已面向开发者、企业与消费者全面开放,开发者入口是 Gemini API(Google AI Studio)、Antigravity、Android Studio 与 Stitch。
接入要点:
模型 ID 直接写
gemini-3.8-flash,稳定版同名,无需 preview 后缀思考等级只能选
low/medium/high,老代码里的minimal会报错长任务优先用 Batch 或 Flex 档,价格是 Standard 的一半
系统提示词长的应用务必开上下文缓存,缓存读取只有输入价的十分之一
选型建议:
消费者侧:Google AI Pro 与 Ultra 订阅用户可在 Gemini 应用、搜索 AI Mode 与 Google Sheets 中使用;企业用户通过 Gemini Enterprise。
常见问题
Q:Gemini 3.8 Flash 和 3.7 Flash 该用哪个? 长周期编程与 Agent 任务用 3.8 Flash,DeepSWE 通过率 74% 对 65%,单任务成本只多 8%。短任务、高并发、计算效率优先的场景留在 3.7 Flash,或用 3.8 Flash 的 low 等级。3.7 Flash 官方承诺继续支持。
Q:为什么说 3.8 Flash 是"Flash 打旗舰"? DeepSWE v1.1 上它与 Claude Opus 5 同为 74%,单任务 2.36 美元对 11.84 美元;Artificial Analysis 智能指数 59 与 Opus 5 medium 持平,输出速度 302 token/s 排同类第三。价格是 Flash,成绩是旗舰。
Q:2027 年涨价影响多大? 输入从 0.75 涨到 1.5 美元,输出从 3.75 涨到 7.5 美元,全档位翻倍。以 DeepSWE 单任务 2.36 美元计,2027 年同样任务约 4.7 美元,仍低于 Opus 5 当前的 11.84 美元,但与 GLM-5.3 的 3.99 美元、Kimi K3 的 4.65 美元拉平。
Q:Gemini 3.8 Flash Cyber 普通开发者能用吗? 不能。仅通过 Fairwind Program 向政府机构、关键基础设施运营方、核心软件维护方和防御性研究实验室开放,需背景审查,禁止转售。普通用户可用公开模型加 CodeMender 做代码安全修复。
Q:Gemini 3.8 Flash 的知识截止日期是什么? 模型卡未标注,只写"最近更新 2026 年 9 月"。[数据待核实:以 deepmind.google 的完整模型卡为准]
总结
Gemini 3.8 Flash 的意义不在参数或价格,而在它把"Flash 价格、旗舰成绩"从口号变成了榜单事实:DeepSWE 与 Opus 5 同分、成本五分之一。代价是模型会跑更长的循环、烧更多 token,短任务用户需要主动降等级或留在 3.7 Flash。竞争格局上,国产模型 GLM-5.3、Kimi K3 落后 5 个百分点但成本相近,GLM-5.3-Flash 以十分之一成本拿到 63%,多模型组合的空间比单选一家更大。2026 年底前的首发价是窗口期,2027 年翻倍后 3.8 Flash 与国产旗舰将处在同一价位带。
据 Google 官方博文,3.8 Flash 是"迄今最好的推理与编程模型,速度与低成本与 3.7 相同";据 DeepSWE 榜单说明,簇内排名因置信区间重叠不具统计意义。本文基于 2026 年 9 月 2 日至 3 日的官方博文、定价页、模型卡、Fairwind 页面、Artificial Analysis 与 DeepSWE 数据,模型迭代节奏为三周一次,建议持续核对。
参考资料
Google 官方博文 Gemini 3.8 Flash and 3.8 Flash Cyber:https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
DeepSWE v1.1 榜单:https://deepswe.datacurve.ai
七牛云 Token Plan(多模型统一接入):https://www.qiniu.com/ai/plan