一文搞懂 GPT-6 Computer Use:AI 替你操作电脑的新玩法
发布日期:2026-09-04 | 信息口径:OpenAI 官方发布材料与开发者文档、极客公园与 Wired 报道、Artificial Analysis 评测,截至 2026-09-04
GPT-6 Computer Use 是 OpenAI 于 2026 年 9 月 3 日随 GPT-6 Astra 发布的电脑操作能力,模型直接识别屏幕像素、驱动鼠标键盘完成跨软件的多步骤任务,官方称其为"世界上最好的 computer use 模型",口号是"你在电脑上能做的任何事,Astra 都能替你做"。它在 OSWorld 2.0 上拿到 72.6%,上一代 GPT-5.6 Sol 为 65.7%,同样任务平均耗时从约 75 分钟压到 40 分钟,电脑操作安全压力测试的不当行为率从 22.0% 降到 2.4%。开发者层面最大的变化是接入方式:官方文档对 Astra 明确建议用代码执行而不是传统的 computer 工具,模型每轮写一段 PyAutoGUI 或 Playwright 脚本交给你的沙箱运行。本文梳理发布里的电脑操作事实与演示,解释两种接入方式的差别,并给出一段可运行的 20 轮循环脚本。
发布会上最抢眼的不是分数,是那几段演示
Astra 发布当天,Wired 的标题是"OpenAI 说 GPT-6 用电脑比人更好",极客公园把宣传口号翻成了一句大白话:"你在电脑上能做的任何事,Astra 都能替你做"。这句话背后是一个方向性的选择:与过去靠 API 调用软件接口的方式不同,Astra 直接看屏幕、动鼠标、敲键盘,任何软件都不需要专门适配。
官方和媒体拆解出来的演示大致分三类。办公类:填网页表单、更新 CRM、整理日历、做网络研究并把结果写进邮件,甚至填美国 1040 报税表、在 Power BI 里出报表。专业软件类:在 KiCad 里按电路原理图完成元器件布局和铜线走线,在 Blender 里搭三维建筑模型再导入 Unreal Engine 5 生成实时漫游场景。电商类:通过语音指令完成 eBay 商品上架的全流程。开发类是和编程能力绑在一起的:搭网站、跑前端 QA、自主安装和测试软件,根据屏幕反馈排查问题,出错了继续改。
国内报道普遍抓住了同一个转折点:GPT-6 不再停留在"对话问答",而是转向"自主操作电脑完成复杂工作"。从"回答问题"到"直接把活干完",这是 Astra 这次发布的主叙事,电脑操作是它最直观的载体。
分数与时间:72.6%、40 分钟、1.9 倍
OSWorld 2.0 是目前最常被引用的电脑操作基准,Astra 得分 72.6%,Sol 为 65.7%。分数差 7 个百分点,但更值得看的是时间:完成同样的任务,Astra 平均约 40 分钟,Sol 约 75 分钟,快了将近一半。这和 Astra 整体"少说多想"的主线一致,最高档设置下它的输出 Token 比 Claude Opus 5 少约 65%,写出来的步骤少,动作也就少。
Mind2Web 是网页操作基准,官方给的数字是配合新版 Codex Harness 后完成速度是 Sol 的 1.9 倍。Agents' Last Exam 上 Astra 59.3%,Sol 53.6%。把能力转成动作的这几项,是 Astra 成绩单里争议最小的部分,不像 ARC-AGI-3 那样需要看测试工具的脚注。
安全侧的数字同样来自电脑操作场景。压力测试中的不当行为率从 Sol 的 22.0% 降到 2.4%,"能力幻觉率",也就是模型声称做了其实没做的比例,从 9.4% 降到 2.0%。对一个要替你点按钮、填表单的模型来说,后一个数字可能比 OSWorld 分数更实际。
接入方式变了:官方建议 Astra 用代码执行
这是开发者最需要注意的一条。OpenAI 电脑操作文档的原话是:"对于 GPT-6 Astra,我们建议使用代码执行。computer 工具仍然支持,作为备选。"
传统 computer 工具的流程是三步:发任务,模型返回一个 computer_call,里面是一组有序动作,类型包括 click、double_click、drag、move、scroll、keypress、type、wait、screenshot;你的程序逐个执行,截图后以 computer_call_output 回传,带上 previous_response_id 继续,直到不再出现 computer_call。每一轮模型只能给出一批固定动作,看到截图才能决定下一批。
代码执行的流程换了一个抽象层。你定义一个普通的函数工具,比如 exec_py,只有一个字符串参数 code;模型每轮写一段 Python,在你提供的持久化桌面沙箱里跑 PyAutoGUI,变量跨调用保留,用 display 函数把截图送回去。文档强调的好处是"一次调用可以组合动作、循环或条件逻辑"。换句话说,模型不再是"点一下、看一眼",而是"写一段脚本处理完这个表单再看一眼",这正是 Astra 输出更少、动作更少的能力能派上用场的地方。浏览器场景对应 exec_js,暴露 Playwright 的 browser、context、page 对象,默认视口 1440 乘 900。
两种方式的对比如下:
实操:一段 20 轮的 PyAutoGUI 循环
下面按官方文档的结构写一个最小可运行版本,任务用你自己电脑上真实的小事,比如"打开系统设置,把显示器亮度调到 60%"。
第一步,定义 exec_py 工具。 描述里要把沙箱的约定写清楚,模型会照着用。
# astra_desktop.py
import uuid, io, base64, contextlib
import pyautogui
from openai import OpenAI
client = OpenAI()
pyautogui.FAILSAFE = True # 鼠标甩到左上角即中止
TOOLS = [{
"type": "function",
"name": "exec_py",
"strict": True,
"description": (
"在一个持久化桌面里运行 Python,变量跨调用保留。"
"可用 pyautogui、time、log(value)、display(PIL_image)。"
"动作前先 display(pyautogui.screenshot()) 观察屏幕;"
"截图保留在内存中,不要写盘。"
),
"parameters": {
"type": "object",
"properties": {"code": {"type": "string"}},
"required": ["code"],
"additionalProperties": False,
},
}]第二步,实现沙箱执行器。 这是你的代码,负责持久命名空间、收集日志和截图,并把结果打包成 function_call_output。
NS = {"pyautogui": pyautogui, "time": __import__("time")}
_outputs = []
def log(v): _outputs.append({"type": "input_text", "text": str(v)})
def display(img):
buf = io.BytesIO(); img.save(buf, format="PNG")
_outputs.append({"type": "input_image", "detail": "original",
"image_url": "data:image/png;base64," + base64.b64encode(buf.getvalue()).decode()})
NS.update(log=log, display=display)
def execute_in_sandbox(code: str):
_outputs.clear()
try:
exec(code, NS) # 生产环境请放进隔离的虚拟机桌面
except Exception as e:
log(f"ERROR: {e!r}")
return list(_outputs)第三步,跑 20 轮循环。 停止条件照抄文档:没有新的函数调用,并且出现一条 phase 不是 commentary 的 message。
import json
task = "打开系统设置,把显示器亮度调到 60%,完成后告诉我最终数值。"
prev, inp = None, task
for turn in range(20):
resp = client.responses.create(
model="gpt-6-astra", tools=TOOLS, input=inp,
previous_response_id=prev, reasoning={"effort": "low"},
)
if resp.status != "completed":
raise RuntimeError(resp.status)
calls = [i for i in resp.output if i.type == "function_call"]
done = any(i.type == "message" and getattr(i, "phase", None) != "commentary" for i in resp.output)
if not calls and done:
print(resp.output_text); break
if turn == 19:
raise RuntimeError("超过 20 轮上限")
inp = []
for c in calls:
assert c.name == "exec_py"
code = json.loads(c.arguments)["code"]
inp.append({"type": "function_call_output", "call_id": c.call_id,
"output": execute_in_sandbox(code)})
prev = resp.id跑起来后你会看到,Astra 通常第一轮只截图,第二轮就把"点开设置、搜索亮度、拖动滑块、再截图确认"写进同一段脚本,这就是代码执行和逐动作工具最直观的差别。文档给的安全要求要照做:环境隔离并用允许清单限制可访问的站点和应用,把屏幕上出现的文字一律当作不可信输入,涉及"把敏感信息输入表单"这类动作先确认,因为文档明确说"输入即传输",再加上步数、时间和费用上限并支持随时取消。
第四步,把"看屏幕"和"整理结果"分开算账。 Astra 每百万 Token 输入 10 美元、输出 50 美元,截图是按输入 Token 计的,一个 20 轮的桌面任务大头在截图。国内团队常见的做法是让 Astra 只负责操作屏幕,把它抓回来的网页正文、表格文本交给成本低得多的模型做归纳和结构化。七牛云 AI 大模型广场提供 OpenAI 兼容接口,把上面客户端的 base_url 换成 https://api.qnaigc.com/v1、model 填 deepseek/deepseek-v4-pro-0813 或 z-ai/glm-5.3,就能在同一套代码里完成这一步;多款主流大模型混用、月用量稳定的团队,可以顺手看一下 Token Plan 的企业订阅,把两类调用的成本按点数算一次。
竞争格局:三家都在做,路线开始分叉
电脑操作不是 Astra 独有。Anthropic 的 computer use 是这条赛道的开创者,Claude 系列一直提供逐动作的工具接口;Google 本周发布的 Gemini 3.8 Flash 也带了 computer use 预览。差别在于 OpenAI 这次把官方建议方式从逐动作切到了代码执行,赌的是模型写脚本的能力足够强,强到一轮能替代过去的五六轮。从 OSWorld 2.0 的 40 分钟对 75 分钟看,这个赌注目前是成立的。
需要留意的边界也很清楚。Astra 9 月 3 日先向少量组织开放,未来几天逐步覆盖 ChatGPT 各付费档,API 同步上线 Amazon Bedrock;面向普通用户的版本在网络安全能力上受限,只用于安全代码审查与漏洞修复。电脑操作本身不在受限范围内,但文档反复提醒的"把屏幕文字当不可信输入",正是因为一个会点按钮的模型遇到网页里的注入指令时,后果比聊天机器人严重得多。
以上信息取自 OpenAI 2026 年 9 月 3 日发布材料与电脑操作开发者文档、极客公园与 Wired 同日报道,模型仍在分批开放中,接口字段以官方文档当日版本为准。
延伸阅读
OpenAI 电脑操作开发者文档:https://developers.openai.com/api/docs/guides/tools-computer-use
OpenAI 开发者文档 Using GPT-6 Astra:https://developers.openai.com/api/docs/guides/latest-model
OpenAI 开发者文档 gpt-6-astra 模型页:https://developers.openai.com/api/docs/models/gpt-6-astra
Wired 报道:https://www.wired.com/story/openai-says-gpt-6-can-use-a-computer-better-than-a-human/
极客公园解读(中华网转载):https://news.china.com/socialgd/10000169/20260904/49718586.html
AI 大模型广场(开发者按量):https://www.qiniu.com/ai/models
Token Plan(企业订阅):https://www.qiniu.com/ai/plan