发布日期:2026-10-01

Gemini 4 Argon 是谷歌 DeepMind 于 2026 年 9 月 30 日发布的新一代旗舰大模型,由 Google DeepMind 高级副总裁兼首席 AI 架构师 Koray Kavukcuoglu 撰文介绍,距上一代旗舰 Gemini 3 系列已近 10 个月。官方将其定位为面向真实世界软件工程、法律与金融等企业知识工作、以及网络安全防御的"前沿智能新阶段"模型,在长周期软件工程基准 DeepSWE v1.1 上拿到 77.9% 刷新纪录,输出 Token 上限从 6.4 万提升到百万级,定价为每百万输入 Token 2 美元、输出 10 美元(推广期价格)。不过这款模型目前并未全面公开,而是先通过 Fairwind Program 提供给受信任的网络安全防御方,待安全防护进一步加固后才会开放给付费 API 客户和 Google AI Ultra 订阅者。本文梳理 Gemini 4 Argon 的真实定价、跑分表现、落地案例和访问限制原因。


Gemini 4 Argon 是什么:谷歌沉寂近 10 个月后的旗舰回应

谷歌官方博客用一句话概括 Gemini 4 Argon 的定位:"在真实世界软件工程、法律与金融等企业知识工作,以及网络安全防御这些复杂工作流中,交付前沿级别的性能表现。"

CEO Sundar Pichai 也在社交媒体上宣布了这一消息,强调该模型在复杂工作流、网络安全防御和软件工程方面展现出前沿水平的性能。

官方把 Gemini 4 Argon 的核心能力总结为三类场景:

  • 真实世界软件工程:从日常调试到大规模代码库迁移、算法设计;

  • 企业知识工作:金融、法律、税务等领域的多步骤深度推理;

  • 网络安全防御:自主发现、验证并修复关键软件漏洞。

模型特性上,为了支撑更长、更复杂的任务,谷歌将 Gemini 4 Argon 的输出 Token 上限从上一代的 6.4 万大幅提升至"行业领先"的 100 万,官方说明这让模型有足够的"思考空间",可以在单次推理轨迹中生成数十万 Token,一次性解决复杂问题,而不是输出上限层面的输入上下文窗口。

跑分到底怎么样:软件工程、金融法律、网络安全均有具体数据

谷歌官方公布的跑分数据集中在三个方向:

基准测试

领域

Gemini 4 Argon 得分

DeepSWE v1.1

真实世界长周期软件工程

77.9%(刷新纪录)

AutomationBench(Zapier)

核心商业流程端到端执行

51.3%(排名第一)

LVBench

长视频理解

91.7%(最先进水平)

CWE-bench v1

安全漏洞修复能力

68%(并列第一)

此外,谷歌表示 Gemini 4 Argon 在 Vals Index(按美国 GDP 贡献权重衡量金融、编程、法律、税务领域经济影响力的综合基准)上排名领先,在 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与撰写)等垂直基准上同样表现突出。

需要说明的是,谷歌给出的基准数据集中在知识工作、长视频理解和网络安全这些方向,纯编程类基准的具体对比数据相对有限,实际编程场景下的表现还需要开发者结合自身任务进一步验证。

定价:推广期打五折,缓存输入省 95%

Gemini 4 Argon 的定价分推广期和常规期两档:

维度

推广期价格

推广期结束后

输入价格(每百万 Token)

2 美元

4 美元

输出价格(每百万 Token)

10 美元

20 美元

缓存输入折扣

较普通输入低 95%

—

输出上限

约 100 万 Token

约 100 万 Token

谷歌官方注明,推广期价格仅在限定窗口内有效,到期后将按常规价格计费,开发者如果计划长期接入,需要提前规划好成本预算,不能默认推广价一直有效。

谷歌内部怎么用:量子优化、内存优化、80 万行代码迁移

谷歌披露了三个具体的内部落地案例,用来说明 Gemini 4 Argon 在真实工程场景中的实际效果:

  • 量子算法优化:Argon 协助量子计算研究团队优化子程序的时空资源消耗(qubit 数 × 门操作数),其中一个案例在几分钟内把已发表的基线结果提升了 40%;

  • 内存效率优化:一组 Argon 智能体分析了谷歌全量数据中心的性能剖析遥测数据,自主识别并应用内存优化方案,已释放超过 300 TiB 内存,预计全面推广后总计可节省 500 TiB 到 1 PiB;

  • 大规模代码库迁移:Argon 智能体正在把谷歌内部 C/C++ 代码库迁移到 Rust,覆盖范围从 re2、libgav1 等数万行规模的核心库,到 Fuchsia 操作系统 Zircon 内核的 80 万行以上代码,由于涉及系统关键性,这类大规模重写在上线前要经过严格的自动化与人工审计、模拟测试和评审。

其中 libgav1(谷歌的开源视频解码器)是一个具体例子:Argon 智能体接手了此前已有的 Rust 移植版本,通过多轮性能剖析实验、研究编译器输出,重写了 3.2 万行 SIMD 代码并写成能被编译器自动向量化的安全 Rust 代码,最终得到的内存安全视频解码器运行速度比原 Rust 移植版快 2.7 倍,视频输出结果完全一致,性能已经接近经过优化的 C++ 版本。

网络安全防御:无防护栏开放给可信防御方

谷歌把网络安全防御作为 Gemini 4 Argon 的重点能力之一,模型可以自主发现、验证并修复关键软件漏洞。针对受信任的防御方和谷歌内部团队,官方表示会"不带网络安全防护栏"地开放 Argon,让他们能完整使用其前沿级别的网络安全防御能力。

安全公司 Wiz 已经通过旗下"Scan for Good"计划(免费为医疗、公共基础设施等关键系统查找并修复高风险漏洞)使用 Argon,一次早期演示中,Argon 发现了此前多款前沿模型都未能识别的严重漏洞——涉及全球医院使用的医疗软件中暴露的敏感个人信息。

为什么普通用户还用不了:先给防御方,再逐步扩大开放

Gemini 4 Argon 没有出现在普通用户的 Gemini 界面里。谷歌采用分阶段发布策略,第一批通过名为 Fairwind Program 的受控早期访问计划,提供给受信任的网络安全防御方,同时谷歌也在积极参与美国政府的自愿预发布模型访问流程。

谷歌给出的理由是:在公开发布前,要先在防范滥用、抵御提示注入攻击、监控模型异常行为、强化测试环境这四个方向加固安全防护。其中监控机制值得关注——官方表示会持续追踪模型的思维链和具体行动,一旦发现模型偏离用户本意、试图用超出预期范围的方式完成任务,就会在必要时终止其执行。等早期测试者的真实反馈帮助团队进一步强化系统后,才会按"付费 API 客户和 Google AI Ultra 订阅者优先"的顺序逐步扩大到更广泛的开发者、企业和消费者群体。

常见问题

Q:Gemini 4 Argon 现在能直接用吗?

目前不能。它只通过 Fairwind Program 向受信任的网络安全防御方和参与美国政府预发布流程的机构开放,普通开发者和企业用户需要等待后续开放阶段,官方表示会从付费 API 客户和 Google AI Ultra 订阅者开始逐步扩大范围,暂无公开的具体时间表。

Q:Gemini 4 Argon 最拿得出手的能力是什么?

从谷歌公布的数据看,三个方向最突出:长周期软件工程(DeepSWE v1.1 得分 77.9%,刷新纪录)、商业流程自动化执行(AutomationBench 排名第一)、网络安全漏洞修复(CWE-bench v1 并列第一)。知识工作类任务整体表现强势,纯编程基准的具体对比数据相对有限。

Q:Gemini 4 Argon 的价格贵不贵?

分推广期和常规期:推广期每百万输入 Token 2 美元、输出 10 美元,缓存输入可再省 95%;推广期结束后价格会上调到每百万输入 4 美元、输出 20 美元,开发者做长期成本规划时需要把这个变化考虑进去。

Q:想低成本横向对比 Gemini 系列和其他主流大模型,有什么办法?

如果只是想体验和对比多款大模型在同一任务下的表现,不涉及申请 Fairwind 这类受限早期访问,类似七牛云 AI 大模型广场这类支持多模型统一接入、同屏对比的平台可以作为更轻量的横向测试起点。

结语

Gemini 4 Argon 的发布更像是谷歌"迟到但有分量"的一次回应:长周期软件工程跑分刷新纪录,内部已经用它优化量子算法、释放数百 TiB 内存、推进 80 万行代码迁移,但谷歌主动选择了先把它交给网络安全防御方这类"守门人",再按付费客户优先的顺序逐步扩大开放范围,这背后既是对模型安全风险的审慎考量,也是当前前沿模型竞争节奏加快之下的一次权衡。本文内容以谷歌官方博客发布信息为准,具体开放时间、定价和功能范围请以 Google 官方页面实时展示为准。

参考资料

  • 谷歌官方博客 Gemini 4 Argon 发布文章:blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon

  • 七牛云 AI 大模型广场:https://www.qiniu.com/ai/models