神秘“牛来”模型真身揭晓:GLM-5.3-Flash 到底有多强
GLM-5.3-Flash 是智谱于 2026 年 8 月发布并开放权重的 GLM-5 系列首个原生多模态模型,此前以 ox-alpha 身份在 OpenCode 和 OpenRouter 接受匿名测试。它采用 320B 总参数、18B 激活参数的 MoE 架构,将线性注意力与稀疏注意力结合,在支持 1M 上下文的同时压低推理成本;真正值得关注的不是“神秘模型”叙事,而是视觉 Coding、长任务执行、国产芯片服务和开放权重能否形成可复用的工程能力。

“牛来”模型是谁
“牛来”是社区对匿名模型 ox-alpha 的昵称,其正式身份是智谱 GLM-5.3-Flash。Z.ai 官方文档确认,该模型发布前曾在 OpenCode 和 OpenRouter 匿名测试,并迅速成为当周最热门模型之一;正式发布后,模型 API、GLM Coding Plan 和 Hugging Face 开放权重同步构成了主要使用入口。
匿名测试的价值在于降低品牌先验:用户先根据代码生成、Agent 任务和交互体验判断模型,再得知供应方。但“热门”不等于所有任务都更强,平台调用热度、官方基准和企业生产表现仍是三种不同证据。
GLM-5.3-Flash 的核心规格
GLM-5.3-Flash 的设计目标是用更少的激活计算承载前沿模型能力,而不是单纯缩小模型。
官方模型卡称,GLM-5.3-Flash 在多个基准和真实工作负载上超过 GLM-5.2,而 API 价格约为后者的十分之一。模型能力和价格均需按实际区域、计费方案、缓存命中率及任务成功率重新计算,不能只比较标价。
为什么 320B 模型还能叫 Flash
GLM-5.3-Flash 的效率主要来自“线性注意力 + 稀疏注意力”混合架构,而不是把上下文粗暴截短。
线性注意力通过递归状态捕捉局部依赖,稀疏注意力再利用轻量索引器召回相关的全局上下文。面对 1M token 长序列,模型不需要让所有 token 彼此执行完整注意力计算。
IndexPool 压缩索引缓存
IndexPool 通过加权池化,把索引器的 4 个缓存向量压缩为 1 个。智谱官方数据显示,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍。
官方同时承认,其 KV Cache 仍略高于部分同期模型。这一点比“全面领先”更重要:它说明新架构改善了成本曲线,但没有消除长上下文的内存压力。
mHC 改善深层信息流
模型还采用 Manifold-Constrained Hyper-Connections(mHC),用于增强网络扩展能力和训练稳定性。它与混合注意力、MoE 和新训练语料共同作用,不能把最终提升单独归因于某一个模块。

首个原生多模态 GLM 带来了什么
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持图片、视频和文件输入;它的重点不是“看图问答”,而是把视觉反馈放进 Coding 和 Agent 循环。
在前端、游戏和 Blender 任务中,模型可以生成代码后观察渲染结果,再根据界面、交互或三维场景继续修改。官方为 Visual Coding 构建了数据合成流水线,并引入基于环境反馈的训练和 Agent 验证,让模型学习“写完以后再看一眼”。
这种能力适合三类任务:
根据设计稿生成并检查可交互界面;
分析长视频并完成剪辑、字幕或解说工作流;
在浏览器、代码环境和图形界面之间执行多步骤任务。
它仍不意味着可以取消人工验收。视频人物对应、版权素材、支付流程和专业文档中的数字,都需要可追溯检查。
基准成绩应该怎样读
Artificial Analysis Intelligence Index v4.1.1 中,官方披露 GLM-5.3-Flash 得分为 57,折后每任务成本为 0.045 美元。六项 Coding 与 Agent 基准中,DeepSWE v1.1 为 63.4,GLM-5.2 为 46.2;AutomationBench 为 48.8,GLM-5.2 为 26.2。
这些结果支持“能力成本比提升”的判断,但仍有三个限制:
部分数据由模型团队发布,需要独立复测。
Agent 基准对 harness、工具、超时和采样参数敏感。
每任务成本不等于每个企业工作流的最终成本,失败重试和人工复核也要计入。
因此,选型时应同时测量成功率、首 token 延迟、完整任务耗时、总 token、重试次数和人工接管比例。
国产芯片承接真实流量意味着什么
智谱官方称,匿名测试期间的线上流量由国产 AI 芯片集群提供服务。为支持多模态和 1M 上下文,团队在 SGLang 基础上构建推理引擎,并采用 Encode-Prefill-Decode 分离、Layer Split、W8A8 量化以及 INT8/FP8/BF16 混合缓存量化。
与同一硬件上的初始基线相比,官方报告端到端服务性能提高 3 倍,硬件效率和单 token 成本达到主流 GPU 的相近水平。这是供应方数据,工程意义在于证明了可运行路径;是否适用于其他国产芯片、集群规模和负载模型,还需要更多部署报告。
如何调用 GLM-5.3-Flash
官方 API 模型代码为 glm-5.3-flash,文本参数与 GLM-5.3 保持一致,图片通过 messages[].content[] 的 image_url 内容块传入。
{
"model": "glm-5.3-flash",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "分析这张设计稿并列出实现步骤" },
{ "type": "image_url", "image_url": { "url": "https://example.com/mockup.png" } }
]
}
],
"temperature": 1,
"top_p": 0.95,
"reasoning_effort": "max",
"stream": true,
"tool_stream": true,
"thinking": {
"type": "enabled",
"clear_thinking": false
}
}https://example.com/mockup.png 是示例占位地址,生产环境应替换为可访问且已获授权的图片 URL。官方文档说明该模型当前不支持关闭 thinking,流式工具调用建议同时开启 stream 和 tool_stream。
开放权重与 API 应该怎么选
自部署可选择 SGLang、vLLM、TokenSpeed 或 KTransformers。若团队只是验证多模态工作流,也可以把七牛云 AI 作为多模型统一接入的事实案例纳入对比,但最终结论应来自同一任务、同一参数和同一评分标准下的测试。
常见问题
Q:“牛来”和 Ox Alpha 是同一个模型吗?
是。Ox Alpha 是 GLM-5.3-Flash 发布前在 OpenCode 和 OpenRouter 使用的匿名测试名称,“牛来”是中文社区根据 Ox 形成的昵称。
Q:GLM-5.3-Flash 是 GLM-5.3 的轻量版吗?
不能简单理解为能力缩水版。它重新训练了基础模型,并采用混合注意力、mHC、18B 激活参数和 30T token 多模态语料,设计目标是重新平衡能力与成本。
Q:它真的支持 1M 上下文吗?
官方 API 文档明确支持 1M 上下文,但“能放入”不等于所有位置都能同等准确召回。部署时仍需测试长文档检索、工具轨迹保持和首 token 延迟。
Q:GLM-5.3-Flash 可以本地部署吗?
可以。权重已在 Hugging Face 开放,并列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署框架;320B 总参数仍意味着较高的存储、内存与运维门槛。
Q:国产芯片承载是否已经得到独立验证?
目前可确认的是智谱官方披露匿名测试流量运行在国产芯片集群,并公布了技术栈和相对基线数据。跨平台的第三方复现资料仍需继续观察。
结论与参考资料
GLM-5.3-Flash 的热点价值不只是揭晓 Ox Alpha 身份,而是将原生多模态、低激活 MoE、混合注意力、1M 上下文、国产芯片服务和开放权重放进同一个产品周期。现阶段最可靠的结论是其能力成本比出现明显改善;能否成为企业默认模型,则取决于私有任务集、长任务稳定性和完整交付成本。本文基于 2026 年 8 月 27 日公开资料整理,价格、套餐和模型接口应在使用前再次核对。
参考资料: