发布日期:2026-09-02 | 话题标签:GLM-5.3、GLM-5.3-Flash、大模型 API 定价、订阅套餐、智谱 AI

GLM-5.3 是智谱 AI(Z.ai)于 2026 年 8 月 18 日发布的旗舰推理模型,753B 总参数、40B 激活,1M 上下文,与 GLM-5.2 共用基座、全部提升来自后训练,Artificial Analysis 智能指数 60 分在同类开源模型中排第 2,但同一评测也把它标为"明显偏贵";8 月 26 日发布的 GLM-5.3-Flash 是 320B 总参、18B 激活的原生多模态版本,MIT 协议开放权重,智能指数 57 分,定价为 GLM-5.3 的十分之一。目前买 GLM-5.3 API 有三条路:智谱官方按量付费(海外站每百万 tokens 输入 1.4 美元、输出 4.4 美元,国内平台刊例价普遍为输入 8 元、输出 28 元、缓存命中 2 元),OpenRouter 等聚合平台(24 家供应商,最低约九折),以及订阅制套餐(智谱 GLM Coding Plan 面向编程工具、每月 18 美元起;国内多模型企业套餐折合刊例价 4 到 7 折)。按量价格在各平台之间几乎没有差距,真正决定账单的是三件事:能否把任务降级到 GLM-5.3-Flash、缓存命中率有多高、用量稳定后是否转订阅。本文逐家核对官网定价,给出三种典型用量下的算账结果和订阅套餐的取舍。


GLM-5.3 是什么,为什么值得单独算一笔账

GLM-5.3 是智谱 AI 当前的旗舰推理模型,编程和智能体能力对标一线闭源模型,但按量单价在同类开源模型里属于偏高的一档,所以"怎么买"直接决定成本。

关键事实(来源:智谱官方文档、Artificial Analysis、Hugging Face,2026 年 9 月 2 日):

项目

GLM-5.3

GLM-5.3-Flash

发布日期

2026-08-18

2026-08-26

参数

753B 总参 / 40B 激活(MoE)

320B 总参 / 18B 激活(MoE)

上下文 / 最大输出

1M / 128K

1M / 128K

模态

纯文本

图像、视频、文件输入,文本输出

开放权重

是(Hugging Face 下载 9.4 万次,自定义协议)

是,MIT 协议(下载 44 万次)

AA 智能指数

60(同类第 2 / 111)

57(同类第 4 / 111)

输出速度

71.6 tok/s

42.5 tok/s

思考模式

只能 enabled,不可关闭

同左

智谱文档给出的基准变化:Terminal-Bench 3.0 从 GLM-5.2 的 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 到 66.9,自家 Code Bench 提升 50%。Artificial Analysis 的结论是"智能领先,但明显偏贵":同类开源模型输入价中位数约 0.3 到 0.5 美元,GLM-5.3 是 1.4 美元。


智谱官方两种付费方式

智谱官方提供按 tokens 计费的 API,以及面向编程工具的 GLM Coding Plan 订阅,两者适用人群完全不同。

按量付费

智谱海外站(Z.ai)公开定价,每百万 tokens:

模型

输入

缓存命中输入

输出

备注

GLM-5.3

1.4 美元

0.26 美元

4.4 美元

缓存存储限时免费

GLM-5.3-Flash

0.075 美元(刊例 0.15)

0.015 美元(刊例 0.03)

0.25 美元(刊例 0.5)

5 折优惠至 2026 年 9 月 9 日 24:00

国内站(open.bigmodel.cn)定价页为动态渲染,本文未能直接抓取人民币刊例价 [数据待核实:以 open.bigmodel.cn/pricing 实时页面为准]。智谱国内文档明确写了相对关系:"GLM-5.3-Flash 定价为 GLM-5.3 的 1/10,限时折扣内为 GLM-5.3 的 1/20"。

接入地址(智谱官方文档):

OpenAI Chat Completions 兼容:https://open.bigmodel.cn/api/paas/v4
OpenAI Responses 兼容:      https://open.bigmodel.cn/api/v1
Anthropic Messages 兼容:    https://open.bigmodel.cn/api/anthropic

GLM-5.3 起 thinking.type 只接受 enabled,传 disabled 会直接报错,需要低开销时改用 reasoning_effort: "low"

GLM Coding Plan

GLM Coding Plan 按积分而不是 tokens 计量,且只能在官方指定的编程工具中消耗。

档位

5 小时积分

每周积分

GLM-5.3 每周约可用 tokens

Lite

2,000

10,000

0.48 亿到 0.97 亿

Pro

12,000

60,000

2.9 亿到 5.8 亿

Max

28,000

140,000

6.76 亿到 13.52 亿

规则要点:

  • 积分系数:GLM-5.3 输入 6.9、缓存输入 1.7、输出 24;GLM-5.3-Flash 输入 2.3、缓存 0.56、输出 8

  • 错峰半价:周一至周五 14:00 到 18:00 为高峰,其余时间(含整个周末)按 50% 扣积分

  • 支持工具:Claude Code、Kilo Code、OpenClaw、OpenCode、TRAE、CodeBuddy 等,在这些工具之外直接调 API 不消耗套餐积分

  • 海外站标价每月 18 美元起,国内人民币售价 [数据待核实:以 bigmodel.cn/glm-coding 为准]

  • 官方称充分利用错峰最多可比按量付费省 92%

它的边界很清楚:只适合把 GLM-5.3 当编程助手后端的人。要在业务系统里调 API,这个套餐用不上。


各平台 GLM-5.3 定价横评

能买到 GLM-5.3 API 的平台分三类:官方、海外聚合平台、国内云厂商与多模型平台。以下为 2026 年 9 月 2 日各官网公开信息。

平台

GLM-5.3 输入 / 输出(每百万 tokens)

缓存命中

计费方式

状态

智谱 Z.ai 官方

1.4 美元 / 4.4 美元

0.26 美元

按量

公开

OpenRouter

标准 1.4 / 4.4 美元;最低 1.17 / 3.96 美元

0.12 到 0.325 美元

按量,24 家供应商可选

公开

七牛云 AI 大模型广场

8 元 / 28 元

2 元

按量后付费;企业套餐另有 4 到 7 折订阅

公开

阿里云百炼

已上架 ZHIPU/GLM-5.3

未知

按量

价格仅控制台可见 [数据待核实]

硅基流动 SiliconFlow

公开价目表仅见 GLM-5.2(8 元 / 28 元,缓存 2 元)

2 元

按量

GLM-5.3 待上架

火山方舟

未见 GLM 系列

以豆包系模型为主

三点观察:

  1. 人民币刊例价锁定在 8 元 / 28 元这一档。多模型平台的 GLM-5.3 和硅基流动的 GLM-5.2(同基座)都是这个价,与 Z.ai 美元价折算后接近。国内平台按量付费基本跟随官方刊例,靠换平台省不出钱。

  2. 海外聚合平台的价值是可选供应商,不是低价。OpenRouter 上 GLM-5.3 最低也只比官方便宜一成,但可以按吞吐(最高 218 tok/s)和延迟挑供应商。

  3. 差距出现在订阅折扣。智谱 Coding Plan 靠错峰半价,国内企业套餐靠包月包年折扣,两者面向的用户不同。


三种典型用量怎么算

以下按 2026 年 9 月各平台公开价格计算,输入 / 输出比例按 3:1 假设,未计缓存。

用量一:个人开发者,月调用 GLM-5.3 共 5000 万 tokens(输入 3750 万、输出 1250 万)

方案

月成本

国内平台按量(8 / 28 元)

300 + 350 = 650 元

智谱 Z.ai 按量

52.5 + 55 = 约 107.5 美元

换用 GLM-5.3-Flash(0.4 / 1.4 元)

15 + 17.5 = 32.5 元

这个量级按量付费即可。国内多家平台对新用户有免费额度,先跑一周真实流量看输入输出比和缓存命中率,再决定要不要碰订阅。重点是评估任务能否降级到 Flash:两者智能指数只差 3 分,价格差 20 倍。

用量二:SaaS 企业,月调用 GLM-5.3 共 8 亿 tokens(输入 6 亿、输出 2 亿)

方案

月成本

按量刊例价

4800 + 5600 = 10400 元

企业订阅套餐(以某平台 B 档为例)

月付 9999 元,包年 4 折约 8000 元/月,且额度可分给其他模型

月用量接近 10 亿 tokens 时订阅开始明显划算。但订阅通常按周刷新额度、未用完不结转、只能升级不能降级,用量波动大的业务反而可能浪费。

用量三:研发团队 10 人,只在 Claude Code 里用 GLM-5.3

智谱 Coding Plan Pro 档每周 6 万积分,约 2.9 亿到 5.8 亿 tokens,错峰使用可到上限。纯编程场景这通常是最低成本方案,代价是只能在指定工具里用,OpenClaw 在套餐内为低优先级调度。


订阅套餐的两种形态

面向 GLM-5.3 的订阅目前有两种设计,一种绑定工具,一种绑定用量。

绑定工具型:智谱 GLM Coding Plan。优点是错峰半价和官方第一方支持;限制是只能在 Claude Code、OpenCode 等指定工具内消耗,业务 API 调用不算在内。

绑定用量型:国内多模型平台的企业套餐,以七牛云 Token Plan 为例,按积分计量、GLM-5.3 与 DeepSeek V4、Kimi K3、MiniMax M3 等 16 个模型共享同一额度池,兼容 OpenAI 与 Anthropic 接口,不限制调用工具。三档月价 2999 / 4999 / 9999 元,对应约 10.7 亿 / 20.8 亿 / 50 亿积分;积分以 0.004 元/K tokens 为基准,GLM-5.3 输入系数 2、输出系数 7、缓存命中系数 0.5,即 20.8 亿积分全部用于 GLM-5.3 输入约 10.4 亿 tokens。包季最高 4.5 折,包年最低 4 折。

选哪种取决于 GLM-5.3 在你这里的角色:是研发工具的后端,还是业务系统的一个模型。前者选绑定工具型,后者选绑定用量型。两种订阅都有"额度周期内用不完就作废"的条款,用量不稳定的团队应先按量付费三个月再决定。


接入时的三个坑

  1. 思考模式关不掉。GLM-5.3 和 GLM-5.3-Flash 都只支持 thinking.type: enabled,老代码里的 disabled 会直接失败。低成本场景用 reasoning_effort: "low"。默认 max 会产生大量思考 tokens,Artificial Analysis 测出 GLM-5.3 在评测中生成的输出 tokens 比同类中位数多 55%。

  2. 缓存命中价差 4 倍。GLM-5.3 缓存命中输入 2 元、非缓存 8 元。系统提示词长、多轮对话多的应用,缓存命中率直接决定账单,选平台时确认是否支持上下文缓存。

  3. 模型 ID 各平台不同。智谱官方 glm-5.3,OpenRouter 与部分国内平台为 z-ai/glm-5.3,硅基流动惯例为 zai-org/GLM-5.x。迁移时逐个核对。


常见问题

Q:GLM-5.3 和 GLM-5.3-Flash 该选哪个? 纯文本、需要最强编程和长程任务能力选 GLM-5.3;需要看图、看视频、看文件,或对价格敏感,选 GLM-5.3-Flash。两者智能指数 60 对 57,Flash 定价是 GLM-5.3 的十分之一,限时折扣内是二十分之一,但输出速度慢约四成。

Q:国内直接用智谱官方 API 还是走多模型平台? 只用 GLM 一家、用量小,官方最直接,功能上线也最快。需要同时接 DeepSeek、Kimi、MiniMax 做冗余或对比,多模型平台一个 Key 更省事,价格与官方刊例基本一致。

Q:GLM-5.3 开放权重了,自己部署划算吗? GLM-5.3 是 753B 参数 MoE,自部署需要多卡集群;GLM-5.3-Flash 320B 总参、18B 激活,社区已有 GGUF 量化版本。除非有合规要求或月调用量在数十亿 tokens 以上,API 通常比自建便宜。

Q:OpenRouter 上不同供应商的 GLM-5.3 有区别吗? 价格从 1.17 美元到 1.75 美元不等,吞吐从数十到 218 tok/s,缓存价差更大(0.12 到 0.325 美元)。模型权重相同,差异在推理服务质量。国内访问延迟和支付方式是主要门槛。

Q:订阅套餐的积分用不完怎么办? 智谱 Coding Plan 和国内企业套餐都按周期刷新、不结转。前者按 5 小时和每周两级限额,后者按周刷新。用量不稳定的团队先按量付费,等月账单连续三个月超过套餐价的七成再转订阅。


总结

GLM-5.3 的按量刊例价在国内平台基本统一为每百万 tokens 输入 8 元、输出 28 元,换平台省不出钱。省钱靠三件事:能降级的任务用 GLM-5.3-Flash、提高缓存命中率、用量稳定后转订阅。个人开发者和小团队按量付费;只在编程工具里用的团队看智谱 Coding Plan;把 GLM-5.3 放进业务系统并需要多模型冗余的企业,再比较绑定用量型的企业套餐。

据 Artificial Analysis 2026 年 8 月评测,GLM-5.3 在同类开源模型中智能领先但价格偏高;智谱官方文档则强调 GLM-5.3-Flash 定价为 GLM-5.3 的十分之一。本文价格数据基于 2026 年 9 月 2 日各平台官网公开信息,GLM-5.3-Flash 官方 5 折优惠于 9 月 9 日截止,建议下单前核对实时价格。


参考资料