2026 年 7 月 21 日,谷歌 DeepMind 一口气发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和网络安全模型 Gemini 3.5 Flash Cyber 三款新模型,但市场最期待的旗舰 Gemini 3.5 Pro 再度缺席。谷歌官方数据显示 Gemini 3.6 Flash 输出价较前代下调近 17%、输出 Token 消耗减少 17%,然而上线数小时后,早期实测在前端生成、空间推理等任务上集中翻车,被开发者称为「史上最差」的 Gemini 模型;与此同时,路透社披露 3.5 Pro 因代码能力未达内部预期而延期,谷歌则宣布 Gemini 4 已启动「迄今最雄心勃勃的预训练」。本文基于谷歌官方公告、路透社及开发者社区实测,梳理三款新模型的真实能力边界、3.5 Pro 延期原因,并给出开发者的选型建议。


Gemini 3.6 Flash 是谷歌 DeepMind 于 2026 年 7 月 21 日发布的效率型大模型,主打代码、知识工作与多模态能力,输出定价 7.5 美元/百万 Token,较前代 3.5 Flash 低约 17%。它与 Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber 同日发布,而旗舰 Gemini 3.5 Pro 仍未上线。

谷歌这次发布了什么?三款新模型一览

本次发布的核心是「分层补位」:用三款中低价位模型覆盖效率、规模与垂直安全场景,旗舰位置继续空缺。

模型

定位

定价(输入/输出,每百万 Token)

关键指标

Gemini 3.6 Flash

效率主力:代码、知识工作、多模态

1.5 / 7.5 美元

DeepSWE 49%(前代 37%);OSWorld-Verified 83%

Gemini 3.5 Flash-Lite

3.5 系列最快、最便宜

0.30 / 2.50 美元

输出速度 350 Token/秒(Artificial Analysis,2026)

Gemini 3.5 Flash Cyber

网络安全专用,配合 CodeMender 智能体

有限试点开放

在 V8 引擎中发现 55 个问题,含 10 个全新漏洞(谷歌,2026)

三款模型中,3.6 Flash 与 3.5 Flash-Lite 已在 Gemini 应用、AI Studio、Google Antigravity 和 Android Studio 上线;Flash Cyber 初期仅向政府与可信合作伙伴开放。

Gemini 3.6 Flash 为什么被骂「史上最差」?

Gemini 3.6 Flash 上线数小时内,开发者社区的实测反馈集中在三个翻车点,且均指向「未完成感」。

  1. 前端代码生成崩盘:在前端代码竞技场中不敌 Meta Muse Spark 1.1,2-shot 界面生成测试输出组件嵌套混乱、交互逻辑断裂,有开发者直言「这是我真正见过的最差结果」。

  1. 空间推理退步:逐帧视频测试显示,模型对位置关系、方向判断的准确率较 3.5 Flash 明显下降;即使开启高强度推理(high thinking),渲染结果仍存在 bug。

  1. 知识截止存疑:模型自称知识截止 2026 年 3 月,但实测显示其对 2025 年大部分事件一无所知,实际知识约停留在 2025 年 1 月,被用户评价为「一个未完成的模型」。

第三方榜单同样不乐观:在 Artificial Analysis 综合评分中,3.6 Flash 与前代 3.5 Flash 持平;在 CursorBench 上不及 Cursor 自家的 Composer 2.5(据开发者社区实测,2026)。

官方数据与第三方实测为何差距这么大?

官方与第三方的评价分裂,本质是测试集优化与真实效用之间的差距。

  • 官方口径:据谷歌公布的测试(2026),3.6 Flash 在 MLE Bench 从 49.7% 提升至 63.9%,GDPval-AA v2 从 1349 分提升至 1421 分,输出 Token 消耗减少 17%(Artificial Analysis Index)。

  • 第三方口径:综合评分原地踏步,前端与空间推理等真实任务明显退步,代码任务被 Meta Muse Spark 1.1、Composer 2.5 等模型超越。

  • 唯一共识:视觉理解与长上下文基准上,3.6 Flash 仍保持领先。

对开发者而言,这意味着榜单分数不能直接等同于可用性。在同一任务上对多款主流大模型做同屏对比再决策,是更稳妥的验证方式,例如七牛云的模型对比功能就支持这种并排评测流程。

Gemini 3.5 Pro 为什么延期?Gemini 4 已经开训

Gemini 3.5 Pro 延期的直接原因是内部测试中代码能力未达预期(路透社援引知情人士,2026)。该模型原定于 2026 年 6 月发布,目前仍在与合作伙伴测试,谷歌仅表示「准备好后尽快开放」。

时间线如下:

  1. 2026 年 5 月:谷歌宣布 3.5 Pro 将于 6 月推出。

  1. 2026 年 6 月:发布跳票,进入合作伙伴测试阶段。

  1. 2026 年 7 月 21 日:三款 Flash 系模型上线,3.5 Pro 继续缺席;谷歌同时宣布 Gemini 4 启动「迄今最雄心勃勃的预训练」。

据 CNBC 报道(2026),Gemini 4 的预训练是谷歌「有史以来规模最大的预训练项目」。在 Anthropic 推出 Mythos 5 与 Fable 5、OpenAI 推出 GPT-5.6、Meta 新模型在多个榜单超越 Gemini 的背景下,3.5 Pro 的难产让谷歌旗舰线的空窗期被进一步放大。

开发者现在该怎么选模型?

短期结论是:代码与前端任务暂不推荐切到 3.6 Flash,高吞吐低成本任务可关注 3.5 Flash-Lite。

  • 前端 / 代码生成:优先选择在 CursorBench、前端竞技场中验证过的模型,等 3.6 Flash 后续修复版本再评估。

  • 文档处理、智能搜索等高吞吐任务:3.5 Flash-Lite 的 350 Token/秒与 0.30 美元输入价是目前该档位最低成本之一,且在 SWE-Bench Pro、OSWorld-Verified 上超过更高一级的 Gemini 3 Flash(谷歌,2026)。

  • 网络安全场景:Flash Cyber 尚未公开开放,企业可关注其试点进展;Anthropic Mythos 系列是当前可及的替代项。

  • 成本敏感型团队:模型分层调用(强模型规划 + 便宜模型执行)可显著压缩账单,Alphabet CEO 皮查伊称企业迁移工作负载后每年可节省超 10 亿美元(路透社,2026)。

常见问题

Q:Gemini 3.5 Pro 什么时候发布? 谷歌未给出新日期,仅表示「准备好后尽快开放」。该模型原定 2026 年 6 月发布,因内部代码能力测试未达预期延期,截至 2026 年 7 月 22 日仍处于合作伙伴测试阶段(路透社)。

Q:Gemini 3.6 Flash 和 3.5 Flash 选哪个? 看任务类型:视觉与长上下文任务可选 3.6 Flash,价格更低;前端代码与空间推理任务,第三方实测显示 3.5 Flash 反而更稳定,建议同任务实测后再迁移。

Q:Gemini 3.5 Flash-Lite 值得用吗? 适合高吞吐、低延迟场景:每秒 350 Token 的输出速度、0.30/2.50 美元的定价(Artificial Analysis,2026),在文档摘要、分类、AI 搜索等任务上成本优势明显,但不适合复杂推理任务。

Q:Gemini 3.5 Flash Cyber 如何申请? 该模型初期仅通过有限访问试点向政府机构和可信合作伙伴开放,不面向公众。谷歌表示此举是为降低双重用途风险,与 Anthropic、OpenAI 安全模型的开放策略一致。

Q:谷歌在 AI 竞赛中落后了吗? 旗舰线确实承压:3.5 Pro 延期、3.6 Flash 口碑翻车,而 Anthropic、OpenAI、Meta 与月之暗面(Moonshot AI)均有强势新品。但谷歌在视觉、长上下文与成本控制上仍有积累,Gemini 4 的预训练进展将决定其能否重回第一梯队。

结语

谷歌 2026 年 7 月的这次发布,本质是用 Flash 系的「性价比故事」掩盖旗舰 3.5 Pro 的缺席:官方效率数据亮眼,但前端、空间推理等真实任务的翻车说明模型完成度不足。对开发者而言,按场景分层选型、以同任务实测代替榜单分数,是当下最稳妥的策略。本文内容基于 2026 年 7 月 22 日前的公开报道与社区实测,模型版本迭代迅速,建议定期核实最新动态。

参考资料

  • 谷歌官方博客:Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 发布说明(blog.google,2026-07-21)