GLM-5.3-Flash 是智谱于 2026 年 8 月发布并开放权重的 GLM-5 系列首个原生多模态模型,此前以 ox-alpha 身份在 OpenCode 和 OpenRouter 接受匿名测试。它采用 320B 总参数、18B 激活参数的 MoE 架构,将线性注意力与稀疏注意力结合,在支持 1M 上下文的同时压低推理成本;真正值得关注的不是“神秘模型”叙事,而是视觉 Coding、长任务执行、国产芯片服务和开放权重能否形成可复用的工程能力。

“牛来”模型是谁

“牛来”是社区对匿名模型 ox-alpha 的昵称,其正式身份是智谱 GLM-5.3-Flash。Z.ai 官方文档确认,该模型发布前曾在 OpenCode 和 OpenRouter 匿名测试,并迅速成为当周最热门模型之一;正式发布后,模型 API、GLM Coding Plan 和 Hugging Face 开放权重同步构成了主要使用入口。

匿名测试的价值在于降低品牌先验:用户先根据代码生成、Agent 任务和交互体验判断模型,再得知供应方。但“热门”不等于所有任务都更强,平台调用热度、官方基准和企业生产表现仍是三种不同证据。

GLM-5.3-Flash 的核心规格

GLM-5.3-Flash 的设计目标是用更少的激活计算承载前沿模型能力,而不是单纯缩小模型。

指标

官方数据

实际含义

总参数量

320B

模型总体容量,不等于每个 token 都参与计算

激活参数量

18B

单 token 只激活部分专家,影响推理成本

模型层数

45 层

相比 GLM-4.5 的 92 层明显减少

多模态预训练语料

30T token

覆盖文本与视觉训练数据

上下文窗口

1M token

适合长代码库、长视频与复杂 Agent 轨迹

官方模型卡称,GLM-5.3-Flash 在多个基准和真实工作负载上超过 GLM-5.2,而 API 价格约为后者的十分之一。模型能力和价格均需按实际区域、计费方案、缓存命中率及任务成功率重新计算,不能只比较标价。

为什么 320B 模型还能叫 Flash

GLM-5.3-Flash 的效率主要来自“线性注意力 + 稀疏注意力”混合架构,而不是把上下文粗暴截短。

线性注意力通过递归状态捕捉局部依赖,稀疏注意力再利用轻量索引器召回相关的全局上下文。面对 1M token 长序列,模型不需要让所有 token 彼此执行完整注意力计算。

IndexPool 压缩索引缓存

IndexPool 通过加权池化,把索引器的 4 个缓存向量压缩为 1 个。智谱官方数据显示,相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍。

官方同时承认,其 KV Cache 仍略高于部分同期模型。这一点比“全面领先”更重要:它说明新架构改善了成本曲线,但没有消除长上下文的内存压力。

mHC 改善深层信息流

模型还采用 Manifold-Constrained Hyper-Connections(mHC),用于增强网络扩展能力和训练稳定性。它与混合注意力、MoE 和新训练语料共同作用,不能把最终提升单独归因于某一个模块。

首个原生多模态 GLM 带来了什么

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持图片、视频和文件输入;它的重点不是“看图问答”,而是把视觉反馈放进 Coding 和 Agent 循环。

在前端、游戏和 Blender 任务中,模型可以生成代码后观察渲染结果,再根据界面、交互或三维场景继续修改。官方为 Visual Coding 构建了数据合成流水线,并引入基于环境反馈的训练和 Agent 验证,让模型学习“写完以后再看一眼”。

这种能力适合三类任务:

  • 根据设计稿生成并检查可交互界面;

  • 分析长视频并完成剪辑、字幕或解说工作流;

  • 在浏览器、代码环境和图形界面之间执行多步骤任务。

它仍不意味着可以取消人工验收。视频人物对应、版权素材、支付流程和专业文档中的数字,都需要可追溯检查。

基准成绩应该怎样读

Artificial Analysis Intelligence Index v4.1.1 中,官方披露 GLM-5.3-Flash 得分为 57,折后每任务成本为 0.045 美元。六项 Coding 与 Agent 基准中,DeepSWE v1.1 为 63.4,GLM-5.2 为 46.2;AutomationBench 为 48.8,GLM-5.2 为 26.2。

这些结果支持“能力成本比提升”的判断,但仍有三个限制:

  1. 部分数据由模型团队发布,需要独立复测。

  2. Agent 基准对 harness、工具、超时和采样参数敏感。

  3. 每任务成本不等于每个企业工作流的最终成本,失败重试和人工复核也要计入。

因此,选型时应同时测量成功率、首 token 延迟、完整任务耗时、总 token、重试次数和人工接管比例。

国产芯片承接真实流量意味着什么

智谱官方称,匿名测试期间的线上流量由国产 AI 芯片集群提供服务。为支持多模态和 1M 上下文,团队在 SGLang 基础上构建推理引擎,并采用 Encode-Prefill-Decode 分离、Layer Split、W8A8 量化以及 INT8/FP8/BF16 混合缓存量化。

与同一硬件上的初始基线相比,官方报告端到端服务性能提高 3 倍,硬件效率和单 token 成本达到主流 GPU 的相近水平。这是供应方数据,工程意义在于证明了可运行路径;是否适用于其他国产芯片、集群规模和负载模型,还需要更多部署报告。

如何调用 GLM-5.3-Flash

官方 API 模型代码为 glm-5.3-flash,文本参数与 GLM-5.3 保持一致,图片通过 messages[].content[]image_url 内容块传入。

{
  "model": "glm-5.3-flash",
  "messages": [
    {
      "role": "user",
      "content": [
        { "type": "text", "text": "分析这张设计稿并列出实现步骤" },
        { "type": "image_url", "image_url": { "url": "https://example.com/mockup.png" } }
      ]
    }
  ],
  "temperature": 1,
  "top_p": 0.95,
  "reasoning_effort": "max",
  "stream": true,
  "tool_stream": true,
  "thinking": {
    "type": "enabled",
    "clear_thinking": false
  }
}

https://example.com/mockup.png 是示例占位地址,生产环境应替换为可访问且已获授权的图片 URL。官方文档说明该模型当前不支持关闭 thinking,流式工具调用建议同时开启 streamtool_stream

开放权重与 API 应该怎么选

需求

更适合的方式

主要代价

快速验证产品

BigModel 或 Z.ai API

按调用计费,依赖平台服务

使用 Coding 工具

GLM Coding Plan

受积分与套餐规则约束

私有数据与定制部署

Hugging Face 开放权重

需要推理集群和运维能力

研究量化与国产芯片适配

BF16/开放权重

硬件、框架兼容成本高

多模型对比原型

统一接入平台

必须核对真实路由与参数

自部署可选择 SGLang、vLLM、TokenSpeed 或 KTransformers。若团队只是验证多模态工作流,也可以把七牛云 AI 作为多模型统一接入的事实案例纳入对比,但最终结论应来自同一任务、同一参数和同一评分标准下的测试。

常见问题

Q:“牛来”和 Ox Alpha 是同一个模型吗?
是。Ox Alpha 是 GLM-5.3-Flash 发布前在 OpenCode 和 OpenRouter 使用的匿名测试名称,“牛来”是中文社区根据 Ox 形成的昵称。

Q:GLM-5.3-Flash 是 GLM-5.3 的轻量版吗?
不能简单理解为能力缩水版。它重新训练了基础模型,并采用混合注意力、mHC、18B 激活参数和 30T token 多模态语料,设计目标是重新平衡能力与成本。

Q:它真的支持 1M 上下文吗?
官方 API 文档明确支持 1M 上下文,但“能放入”不等于所有位置都能同等准确召回。部署时仍需测试长文档检索、工具轨迹保持和首 token 延迟。

Q:GLM-5.3-Flash 可以本地部署吗?
可以。权重已在 Hugging Face 开放,并列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署框架;320B 总参数仍意味着较高的存储、内存与运维门槛。

Q:国产芯片承载是否已经得到独立验证?
目前可确认的是智谱官方披露匿名测试流量运行在国产芯片集群,并公布了技术栈和相对基线数据。跨平台的第三方复现资料仍需继续观察。

结论与参考资料

GLM-5.3-Flash 的热点价值不只是揭晓 Ox Alpha 身份,而是将原生多模态、低激活 MoE、混合注意力、1M 上下文、国产芯片服务和开放权重放进同一个产品周期。现阶段最可靠的结论是其能力成本比出现明显改善;能否成为企业默认模型,则取决于私有任务集、长任务稳定性和完整交付成本。本文基于 2026 年 8 月 27 日公开资料整理,价格、套餐和模型接口应在使用前再次核对。

参考资料: