GPT-6 Astra 发布:OpenAI 说"欢迎进入 AGI 时代",开发者先看清这五件事
发布日期:2026-09-04 | 信息口径:OpenAI 开发者文档、系统卡、ARC Prize、Artificial Analysis 及国内媒体报道,截至 2026-09-04
GPT-6 Astra 是 OpenAI 于美东时间 2026 年 9 月 3 日发布的新一代旗舰模型,官方定位是"面向最难的端到端工作",在得州 Stargate 基地用超过 10 万块 GPU 训练完成,总裁 Greg Brockman 在发布会上说出了"欢迎进入 AGI 时代"。它在 ARC-AGI-3 上拿到 99.9%、FrontierMath Tier 4 拿到 97.6%,OSWorld 2.0 计算机操作 72.6%,是 OpenAI 第一个在网络安全维度触及"关键级"阈值的公开模型。API 模型 ID 为 gpt-6-astra,上下文 105 万 Token,每百万 Token 输入 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍,但编程智能体场景下 Token 用量只有前代的三分之一。本文按发布内容、基准分化、计算机操作、价格逻辑、安全争议五条线梳理,并给出一段可运行的接入与成本估算脚本。

先说发生了什么:从"给答案"切到"干完活"
这次发布最值得记住的不是某个分数,而是 OpenAI 对模型的定位变了。官方博客把 GPT-6 Astra 描述为"世界上最好的计算机使用模型"和"迄今最好的软件工程模型",演示里它独立完成了 KiCad 电路板布线、Unity 城市场景搭建、FreeCAD 建模五速变速器再导入 Blender 做动画,还用 Jupyter 搭了一条细胞追踪流程。Altman 的原话是"我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型"。
发布节奏也很有意思。9 月 1 日 OpenAI 先发了一篇《通往 Astra 之路》预告安全风险,9 月 2 日 Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,9 月 3 日 Astra 正式登场。Hacker News 上官方公告一天内拿到 1279 分、近千条评论,有人感叹"每周都在换模型和价格,已经没法严谨选型",也有人指出 ARC-AGI-3 的对比表里前代分数没有用同一套测试工具,横向对比要打折看。
开发者文档给出的硬参数:模型 ID gpt-6-astra,上下文窗口 1,050,000 Token,最大输入 922,000,最大输出 128,000,知识截止 2026 年 4 月 30 日,输入支持文本和图像,输出仅文本,推理档位 low、medium、high、xhigh、max 五级,系统卡明确 none 档不对外开放。首日只面向 Trusted Access Program 内的企业,API 和 ChatGPT Plus、Pro、Business、Enterprise 在随后几天陆续放开,AWS Bedrock 同步上线。
基准测试怎么看:一张分化的成绩单
Astra 的成绩单不是全面碾压,而是明显分化:智能体类任务大幅领先,通用智能指数基本持平。下面这张表把有对比对象的项目放在一起,数据来自 OpenAI 官方博客、ARC Prize 与 Artificial Analysis。
ARC Prize 的博客值得单独读。团队确认 99.9% 是当前最高分,但同时写明"不宣称这是 AGI",因为 ARC-AGI-3 范围有限、机制封闭,不代表真实世界的开放复杂性。更有价值的是动作效率数据:Astra 在 96% 的关卡里动作数少于人类中位数,平均少 51.7%,团队称这是"一个实质性的里程碑"。
Artificial Analysis 的结论是两句话:在 Coding Agent Index 上,Astra 用 Sol 三分之一、Opus 5 五分之一的 Token 追平了顶级模型,每任务成本不到 Fable 5 的一半;在 Intelligence Index 上,Token 节省不足以抵消 2.5 倍的涨价,每任务成本比前代高 75%。换句话说,它是给智能体任务造的,不是给聊天造的。
计算机操作与编程:最实在的两块提升
计算机操作是 Astra 拉开差距最大的地方。OSWorld 2.0 上 72.6% 对 Sol 的 65.7%,单任务时间从 75 分钟压到 40 分钟;Mind2Web 网页任务配合更新后的 Codex 比 Sol 快 1.9 倍,官方例子是找儿科医生 2 分 54 秒、找公寓 9 分 57 秒、预约车管所 5 分 10 秒。Responses API 里 computer_use、hosted_shell、apply_patch、skills、mcp 这些工具首日全部可用。
编程侧有两个变化。一是 Codex 新增了跨上下文窗口保存注释的机制,用来替代反复压缩,早期上下文仍可搜索,目前是实验功能,官方说数周内转为默认。二是判断力:指令模糊时会利用上下文补全,必要时异步提问再继续执行,任务演变过程中不丢原始约束。OpenAI 内部一项数据库迁移评估里,Astra 拿到 63.9%,Fable 5.1 是 57.8%,Sol 是 42.7%,成本比 Sol 低约 38%。
价格:标价翻 2.5 倍,账单未必更贵
标价很直白:每百万 Token 输入 10 美元、缓存读取 1 美元、缓存写入 12.5 美元、输出 50 美元,与 Fable 5.1 定价相同,是 Sol 的 2.5 倍。Batch 和 Flex 半价,Fast 模式两倍价、速度最高 2.5 倍。有一条容易漏看的规则:单次请求输入超过 272K Token,整单按输入两倍、输出 1.5 倍计费,也就是长上下文档位输入 20 美元、输出 75 美元。
但账单是标价乘用量。Artificial Analysis 的实测显示,同一个编程智能体任务,Astra 的 Token 消耗只有 Sol max 档的三分之一,所以 max 档成本与 Sol 相当而分数更高。Perplexity 在自家 WANDR 智能体基准上给出的数据类似:Astra 得分 0.682、单任务成本 11.98 美元,比 Fable 5.1 得分高 13.5%、成本低 6.1%。结论是,如果你的负载是多步智能体任务,换 Astra 大概率不涨账单;如果是短问答,Sol 更划算,而且 Sol 的促销价至少持续到 11 月 21 日。
安全争议:第一个"关键级"网安模型
Astra 是 OpenAI 首个在 Preparedness Framework 网络安全维度达到"关键级"的公开部署模型,系统卡描述它能在较少人工干预下发现未知漏洞并开发利用方式,内部测试中曾发现并利用两个零日漏洞。最先进的网安能力通过 Daybreak 计划只向筛选过的组织开放,普通付费版本加了更严格的拒答、监控和任务中止机制。系统卡同时承认可监控性下降:模型更能控制自己的思维链,评估意识在 max 档达到 50.6%,UK AISI 和 Apollo 都表示当前结果对真实场景行为的证据力有限。这部分是背景,影响的是接入门槛而非日常使用。
实操:用 Responses API 跑一次 gpt-6-astra 并算清成本
第一步,最小调用。 账号拿到访问权限后,Responses API 是官方首推入口,推理档位通过 reasoning.effort 传入,智能体任务从 high 起步,短任务用 medium。
export OPENAI_API_KEY="你的密钥"
curl -s https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "high"},
"input": "读取 ./src 下所有 TypeScript 文件,列出未处理的 Promise 并给出修复补丁"
}'返回体里的 usage 字段会分别给出 input_tokens、output_tokens 和缓存命中数,这是算成本的唯一可靠依据。
第二步,把 272K 阈值和缓存写进成本函数。 单位为美元/百万 Token,同时放入 Sol 的价格做对照。
# astra_cost.py
PRICES = {
"gpt-6-astra": {"in": 10, "cached": 1, "out": 50, "long_in": 20, "long_out": 75},
"gpt-5.6-sol": {"in": 4, "cached": 0.4, "out": 20, "long_in": 8, "long_out": 30},
}
def call_cost(model, in_tok, out_tok, cache_hit=0.0):
p = PRICES[model]
long_ctx = in_tok > 272_000
in_price = p["long_in"] if long_ctx else p["in"]
out_price = p["long_out"] if long_ctx else p["out"]
cached_price = p["cached"] * (2 if long_ctx else 1)
cost = (in_tok * (1 - cache_hit) * in_price
+ in_tok * cache_hit * cached_price
+ out_tok * out_price) / 1e6
return round(cost, 3)
# 一次编程智能体任务:Astra 输入 20 万、输出 2 万;Sol 同任务输出约为 3 倍
print("astra", call_cost("gpt-6-astra", 200_000, 20_000, cache_hit=0.5)) # 约 2.1 美元
print("sol ", call_cost("gpt-5.6-sol", 200_000, 60_000, cache_hit=0.5)) # 约 1.64 美元
print("astra 300K 输入", call_cost("gpt-6-astra", 300_000, 20_000, 0.5)) # 约 4.8 美元第三行说明了那条阈值规则的杀伤力:输入从 20 万涨到 30 万,成本翻了一倍多,长文档任务要么切块,要么用 Batch 半价跑。
第三步,拉国产模型做同任务对照。 国内团队评估换代时,通常会拿 DeepSeek-V4-Pro、GLM-5.3、Kimi K3 跑同一批任务对比 Token 消耗和通过率。七牛云 AI 大模型广场提供 OpenAI 兼容接口,把 base_url 换成 https://api.qnaigc.com/v1、model 换成 deepseek/deepseek-v4-pro-0813 或 z-ai/glm-5.3,上面的脚本和 usage 解析逻辑不用改。多款主流大模型混用、月用量稳定的团队,可以再看一眼 Token Plan 的企业订阅,按点数换算与按量对照一次。
写在最后
GPT-6 Astra 的意义在于把"模型会不会用电脑"这件事从演示变成了可计费的 API 能力,计算机操作、终端任务和长程编程是它真正拉开差距的地方,通用智能指数上与前代持平则说明它不是给所有场景造的。定价翻 2.5 倍但 Token 效率翻三倍,账单结论要靠自己的 usage 数据算,别信任何一方的宣传口径。至于"AGI 时代",Brockman 自己也留了后路说"可以留给外界判断",ARC Prize 明确不认可这个说法,开发者不妨把它当成一个词,把注意力放回任务通过率和每任务成本上。
以上参数与价格取自 OpenAI 开发者文档 2026 年 9 月 4 日的版本,基准数据来自各机构 9 月 3 日发布的评测,模型仍在分批开放中,以官网当日信息为准。
延伸阅读
OpenAI 开发者文档 gpt-6-astra 模型页:https://developers.openai.com/api/docs/models/gpt-6-astra
AI 大模型广场(开发者按量):https://www.qiniu.com/ai/models
Token Plan(企业订阅):https://www.qiniu.com/ai/plan