发布日期:2026年8月24日 | 话题分类:AI 模型动态 | 时效性:本文基于2026年8月24日公开数据

Ox Alpha 是 2026年8月20日在 OpenRouter 上匿名上线的神秘 stealth 推理模型,支持文本、图像、视频三模态输入,上下文窗口约100万tokens,预览期完全免费。技术指纹分析高度指向智谱AI(Zhipu AI)未发布的GLM-5.x多模态变体——分词器与GLM-5.3精确对齐,视频编码器行为与GLM-5V-Turbo完全一致。用户组织的DeepSWE编程测试中,Ox Alpha 以约80%通过率超越多款主流旗舰模型,并以51,469项回归测试全部通过、69次工具调用仅出错1次获得开发者认可;目前可通过 OpenRouter API 免费接入,适合大型代码库审查和长流程 Agent 工作流,但因来源不明,不建议提交敏感数据。



Ox Alpha 是一个没有官方发布公告、没有技术报告、没有开发者署名的 AI 模型——但它在上线四天内登上了 Bloomberg、TechCrunch、The Next Web 等12家国际媒体的报道。这种反常的爆发,背后有三条硬线索。

为什么"Ox Alpha"在开发者社区爆火?

Ox Alpha 的出现方式打破了惯例。 2026年8月20日,一个自称"stealth"的匿名提供商在 AI 模型聚合平台 OpenRouter 上线了这一模型,模型ID为 stealth/ox-alpha,没有任何官方声明。

三个关键因素让它迅速被引爆:

  • 完全免费:预览期内每日声称可处理100万亿tokens,API调用零费用,无需信用卡或注册信息

  • 罕见的超大上下文:1,048,576 tokens的上下文窗口,可容纳完整代码仓库或超长技术文档

  • 编程测试表现抢眼:在用户自组织的编程任务测试中,Ox Alpha以约80%通过率超越了同期参测的多款主流旗舰模型

截至2026年8月24日,该模型已累计处理超过180亿 tokens 的编程 Agent 流量,36Kr 以"牛来了"为题跟进,X 平台讨论量持续攀升。


技术规格:100万 Token 上下文能做什么?

Ox Alpha 的核心规格如下:

参数

数值

模型ID

stealth/ox-alpha

上线日期

2026年8月20日(OpenRouter)

上下文窗口

1,048,576 tokens(约100万)

最大输出

131,072 tokens

输入模态

文本 + 图像 + 视频(不含音频)

架构(推测)

MoE,约744B总参数 / 40B活跃参数

吞吐量

中位数28 tokens/秒

响应延迟

中位数约4秒

定价

预览期免费

100万token的上下文窗口意味着可以将整个大型代码库直接粘贴进对话,或同时输入一份完整的法律合同及全部修订历史。但独立研究者也明确指出:大上下文窗口不等于模型能有效利用每一个token——目前缺乏对超长输入下实际表现的独立验证数据,这一能力边界有待观察。


幕后黑手是谁?证据全梳理

目前证据最充分的推测是:Ox Alpha 是智谱AI(Zhipu AI)未公开发布的 GLM-5.x 多模态变体

独立研究员 Ben Davis 对25个不同提示进行了系统性测试,汇总出四条关键指纹证据:

证据一:分词器精确对齐 Ox Alpha 与 GLM-5.3 的 token 计数完全一致,仅存在固定的 +75 token 隐藏包装差异,强烈暗示双方共享同一词汇表。

证据二:视频编码器行为完全一致 四组视频测试中,Ox Alpha 与 GLM-5V-Turbo 的 token 消耗完全相同,采样率约 147 tokens/秒,帧率无关——这种精确匹配在概率上难以归因于巧合。

证据三:API 错误代码关联 错误代码1210曾被记录与 Z.ai(智谱旗下平台)相关联;触发错误时返回中文错误日志。

证据四:排除其他候选模型 小米 MiMo v2.5(支持音频输入,而 Ox Alpha 明确拒绝音频)、Qwen 3.8 Max(视频编码器特征存在明显差异)均被排除。

候选模型

排除理由

小米 MiMo v2.5

支持音频输入,而 Ox Alpha 不支持

Qwen 3.8 Max

视频编码器特征明显不同

GLM-4.6V

视频编码行为与 Ox Alpha 不匹配

社区结论:99%确定 Ox Alpha 属于智谱AI未发布的 GLM-5.x 系列。公开版 GLM-5.3 仅支持文本,若推测成立,Ox Alpha 是其首个多模态变体的外部压测版本——免费放量正是大规模正式发布前进行真实流量测试的典型策略。


Benchmark 测试:它真的超越了旗舰模型吗?

Ox Alpha 最广为流传的数据,来自用户自组织的 DeepSWE 编程任务测试(共10个子任务):

模型

DeepSWE 得分(用户测试)

Ox Alpha

~80%

Claude Fable 5

~65%

GLM-5.3

~62%

Grok 4

~62%

GPT-5.6 Sol

~52%

⚠️ 重要背景说明: 上述数据来源于10个任务的小样本用户测试,非官方基准审计。DeepSWE 与行业标准 SWE-bench Verified 是不同测试集,不可直接横向比较——在完整的 SWE-bench Verified 上,多款主流模型得分均在96%以上。

更具说服力的单项亮点:

  • "Meriyah Explicit Resource Declarations"任务:Ox Alpha 首次尝试即通过,而该任务此前记录中其他3款参测主流模型的得分均为0/4

  • 全量回归测试:通过全部 51,469 项回归测试,零失败

  • Agent工作流稳定性:69次工具调用中仅出错1次,无重试循环

  • 多名开发者报告:发现了 Python 项目中其他工具遗漏的2个真实 bug


如何免费接入 Ox Alpha?三种方式

方式一:OpenRouter API(开发者首选)

兼容标准 OpenAI SDK,预览期 token 费用为零:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<YOUR_OPENROUTER_API_KEY>",
)

response = client.chat.completions.create(
    model="stealth/ox-alpha",
    messages=[{"role": "user", "content": "审查以下 Python 代码的潜在 bug"}]
)
print(response.choices[0].message.content)

对于同时使用多款模型的开发者,统一的 API 接入层可以避免在不同平台间频繁切换密钥和格式。国内的七牛云 Token Plan(qiniu.com/ai/plan)支持通过单一接口管理多款主流大模型的调用,对于需要横向评测 Ox Alpha 与其他模型的场景,可作为对比测试的统一入口。

方式二:OpenCode 集成

在 OpenCode 中连接 Zen 提供商,使用 /models 命令选择,模型标识符为 x-preview-f-free

方式三:无代码 Playground

访问 oxalpha.com,通过 OpenRouter 账号登录即可在网页端直接测试,无需任何配置。


适合哪些场景?不适合哪些场景?

推荐场景:

  • 大型代码库审查:100万 token 上下文是核心优势,无需拆分代码库即可整体输入

  • 长流程 Agent 工作流:69次工具调用出错率极低,适合多步骤自动化任务

  • 前端界面生成与迭代:用户实测反馈好于同期多款免费模型

  • 回归测试辅助:51,469项回归全部通过,表明代码理解的系统性较强

不推荐场景:

  • 对响应速度敏感的实时应用(4秒延迟 + 长推理时间,不适合低延迟场景)

  • 从零构建复杂后端系统(实测稳定性有波动,结果不一致)

  • 音频输入的多模态任务(明确拒绝音频)

  • 生产环境敏感数据处理(见下方隐私风险说明)


使用前必读:风险与局限

隐私风险: OpenRouter 列明,匿名提供商会保留提示和输出内容(声称不用于训练),与 OpenCode 平台宣传的"零数据保留"存在矛盾。建议在使用时不提交密码、个人身份信息或专有商业代码。

来源不透明: 开发者身份至今未公开,无技术报告,无模型卡,运营条款不明。Nous Research 等开发者已将其集成进 Hermes Agent 工作流,属于基于自测的主动采纳,而非经官方认证的合规接入。

定价不确定性: 预览期免费策略可能随正式发布而改变,将其纳入生产链路存在中断风险。X 平台研究员 VaibhavSisinty 指出,Ox Alpha 是六个月内在主要分发平台上出现的第五个 stealth 模型,匿名发布测试后正式商业化的模式正在成为规律。


常见问题

Q:Ox Alpha 是 GLM-5.3 吗? 目前证据高度指向智谱AI旗下 GLM-5.x 系列的未发布多模态变体,但官方从未确认。公开版 GLM-5.3 仅支持文本,而 Ox Alpha 支持图像和视频,若推测属实则为更高规格的多模态版本。

Q:Ox Alpha 免费使用有什么限制? 截至2026年8月24日,通过 OpenRouter 和 OpenCode 可免费调用,API token 零费用,无信用卡要求。但这是预览期政策,随正式发布可能调整,也不排除存在流量限速。

Q:DeepSWE 80% 能说明 Ox Alpha 比 GPT-5 或 Claude 更强吗? 不能直接得出此结论。该数据来源于10个任务的小样本用户测试,非官方审计。在完整的 SWE-bench Verified 基准上,多款主流模型得分均超过96%——两个测试集之间不可横向比较。

Q:如何在 Cursor 或 VS Code 中接入 Ox Alpha? 将 OpenRouter 设置为自定义 API 提供商(base_url 填 https://openrouter.ai/api/v1),模型 ID 设为 stealth/ox-alpha,支持自定义模型端点的编辑器插件均可使用。

Q:为什么有人认为 Ox Alpha 是中国实验室开发的? 除技术指纹外,免费放量测试的策略、后端中文错误日志、与国内平台 API 错误代码的关联,三者叠加使得社区倾向于中国实验室方向。Bloomberg、Business Insider 等媒体的报道也明确提及"some suspect a Chinese lab"。


结语

Ox Alpha 代表了一种新的模型发布模式:以匿名"stealth"形式在真实开发者场景中进行大规模流量压测,而不是发布技术报告后等待市场自然采纳。

据独立研究员 Ben Davis 的分词器和视频编码器分析,智谱AI极大概率是其开发方;截至2026年8月24日,Ox Alpha 已处理超过180亿 tokens 的编程 Agent 流量(运营方自报)。对于开发者而言,当下是以零成本测试这款模型的窗口期,尤其适合大上下文代码审查和 Agent 工作流的能力评估。在将其纳入生产链路前,建议先在非敏感代码上充分评估稳定性与数据隐私边界。

本文内容基于2026年8月24日公开数据,Ox Alpha 来源及商业化进展持续演变,建议关注后续官方声明。


延伸阅读