发布日期:2026年8月19日 | 话题:AI模型 · GLM-5.3 · 智谱AI · API接入 · 编程模型

智谱AI于2026年8月14日发布GLM-5.3,并于2026年8月19日正式开放API。这是GLM-5系列的首个后训练强化版本:基础模型与GLM-5.2共用同一底座(7530亿参数,来源:Artificial Analysis,2026年8月),所有能力提升完全来自后训练,不依赖参数扩容。在Artificial Analysis综合智能指数评测中,GLM-5.3(max档)以60分在181个参测模型中排名第8(数据来源:Artificial Analysis,2026年8月19日),与Claude Fable 5、GPT-5.6 Sol等闭源旗舰处于同一智能区间。编程方面,DeepSWE v1.1得分从GLM-5.2的46.2升至66.9(+44.8%),Terminal-Bench 3.0从4.6跳至28.3;网络安全方面CyberGym得分84.5%,超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。本文覆盖GLM-5.3的核心变化、API接入配置(含迁移注意事项)、定价与场景选型建议。


核心变化:三个方向的集中突破

变化一:编程能力全面跃升

GLM-5.3在三项编程与Agent基准上均有显著提升:

基准测试

GLM-5.2

GLM-5.3

提升幅度

DeepSWE v1.1(代码修复)

46.2

66.9

+44.8%

Terminal-Bench 3.0(终端Agent)

4.6

28.3

+6倍

Agents' Last Exam(综合Agent)

23.8

28.5

+19.7%

(数据来源:Z.ai官方文档,2026年8月)

Terminal-Bench 3.0的跳跃幅度最为显著——从4.6到28.3意味着GLM-5.3在终端Agent任务上从几乎不可用升级到具备实用价值。Z.ai Code Bench评测显示,GLM-5.3(max档)在完成编码任务时每任务输出约75K token,而GLM-5.2需要约96K token——效率提升的同时完成率也更高。智谱官方将编程能力提升幅度描述为"50%"(来源:智谱AI官方,2026年8月14日)。

GLM-5.3已接入ZCode(zcode.z.ai)代码工具和AutoClaw(autoglm.zhipuai.cn)办公Agent,是两款产品的当前主力模型。

变化二:网络安全能力对标顶尖闭源模型

CyberGym综合得分84.5%,超过Mythos 5(83.8%)和GPT-5.6 Sol(83.6%),在参测模型中排名第一(来源:Z.ai官方文档,2026年8月)。

具体数据:

基准

GLM-5.2

GLM-5.3

对比模型

CyberGym

77.2%

84.5%

Mythos 5: 83.8% / GPT-5.6 Sol: 83.6%

ExploitBench

24.4%

54.4%

Mythos 5: 78.0%

ExploitGym 2h

29任务

105任务

Mythos 5: 181任务

智谱同步建立了Z.ai Security Disclosure Ledger公开漏洞披露记录,已完成269个真实代码库扫描,发现2,436个漏洞(其中中高危1,097个,最早漏洞存在约40年)。ExploitBench得分相较GLM-5.2超过翻倍,但与Mythos 5仍有差距(54.4% vs 78.0%),网络安全场景仍以辅助审查为主,不建议无监督自主漏洞利用。

变化三:思考模式强制开启,不可关闭

这是从GLM-5.2迁移到GLM-5.3时最需要注意的变化。

GLM-5.3的thinking.type只支持"enabled",不再接受"disabled"值。如果沿用GLM-5.2的配置直接切换模型ID,会导致请求失败。同时新增了reasoning_effort参数,支持三档调整:

档位

适用场景

Token消耗

low

简单问答、快速响应

最低

high

标准编码、推理任务

中等

max

复杂Agent、深度推理

最高(默认)

默认档位为max,适合复杂任务但成本最高。高频简单调用建议显式设置reasoning_effort: "low"以控制成本。


API 接入:快速上手

GLM-5.3支持三种接入协议,适配不同技术栈:

端点信息

协议

Base URL

OpenAI Chat Completion

https://open.bigmodel.cn/api/paas/v4

OpenAI Response

https://open.bigmodel.cn/api/v1

Anthropic Message

https://open.bigmodel.cn/api/anthropic

OpenAI SDK 快速接入示例

from openai import OpenAI

client = OpenAI(
    api_key="your-bigmodel-api-key",
    base_url="https://open.bigmodel.cn/api/paas/v4"
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "审查这段代码并找出潜在的安全漏洞"}],
    extra_body={
        "thinking": {"type": "enabled"},
        "reasoning_effort": "high"  # low / high / max
    }
)
print(response.choices[0].message.content)

从 GLM-5.2 迁移的改动清单

  1. model改为"glm-5.3"

  2. thinking.type: "disabled"改为"enabled"(否则请求失败)

  3. 按场景设置reasoning_effort档位,避免默认max在简单任务上浪费成本

  4. 支持上下文缓存(Context Caching),长会话场景可显著降低成本


定价与成本

Artificial Analysis基准评测中,GLM-5.3的输入价格约¥10/百万token,优于参测模型中位数(约¥12.6/百万token,数据来源:Artificial Analysis,2026年8月19日)。智谱官方声明API定价与GLM-5.2保持一致,非高峰时段(含周末全天)仅消耗标准积分的50%——相当于夜间和周末调用成本减半。

模型权重预计于发布后一周开源(来源:智谱AI官方,2026年8月19日),开源后支持本地部署,可进一步降低持续调用成本。

成本注意事项

  • 默认reasoning_effort: "max"会产生较长的思考链输出,约为GLM-5.2标准输出的2.4倍冗长度(Artificial Analysis数据)。对成本敏感的场景建议先用lowhigh档测试效果再决定档位

  • 上下文缓存命中可大幅降低输入成本,长会话和RAG场景值得优先开启

  • 速度:74 tokens/s,TTFT 2.05秒(181模型中速度排名第71);对实时交互要求高的场景需提前压测


场景选型:什么任务用GLM-5.3,什么时候考虑其他选择

适合用GLM-5.3的场景

  • 代码审查与漏洞扫描:CyberGym 84.5%排名第一,可替代部分人工安全审查流程

  • 中等复杂度编程任务:DeepSWE 66.9,成本低于Kimi K3,适合作为主力编码模型

  • 终端Agent任务:Terminal-Bench 3.0从4.6跳至28.3,具备实用价值

  • 成本敏感的高频调用:定价低于Kimi K3约3倍以上,适合日用量大的团队

需要考虑其他模型的场景

  • 图像/多模态输入:GLM-5.3当前版本仅支持文本,如需处理截图、图表,选Kimi K3(原生多模态)

  • 超长上下文真实利用:两者均支持1M token,但Kimi K3的BrowseComp和长文本推理评分更高

  • 最高动态代码逻辑精度:GLM-5.3在复杂算法题上仍落后Claude/GPT约8分

  • ExploitBench满分要求:54.4%与Mythos 5的78.0%仍有差距,高风险渗透测试场景不适合

对于需要在GLM-5.3、Kimi K3、DeepSeek V4等多个国产模型之间分层调用的团队,七牛云Token Plan(qiniu.com/ai/plan)支持统一订阅接入,一个API Key按需切换25个主流国产模型,免去多账户分别管理账单的成本。


开发者资源汇总

资源

地址

BigModel API文档(glm-5.3接入)

docs.bigmodel.cn/cn/guide/models/text/glm-5.3

Z.ai API文档

docs.z.ai/guides/llm/glm-5.3

GLM Coding Plan(编程场景订阅)

bigmodel.cn/glm-coding

ZCode在线代码工具

zcode.z.ai/cn

AutoClaw办公Agent

autoglm.zhipuai.cn

Z.ai在线体验

chat.z.ai

智谱清言App

chatglm.cn

官方发布Blog

z.ai/blog/glm-5.3


FAQ

GLM-5.3的思考模式强制开启,成本会比GLM-5.2高很多吗?

取决于reasoning_effort档位。设置为low时,思考链较短,成本接近GLM-5.2;设置为max(默认)时,冗长度约为普通模型的2.4倍(Artificial Analysis数据),成本相应增加。建议按任务类型显式设置档位:简单问答用low,编码用high,复杂Agent用max,不要让所有请求都走默认max档。

GLM-5.3和Kimi K3应该怎么选?

两个模型当前价格区间差距在3倍以上,核心差异在于:GLM-5.3擅长网络安全审查(CyberGym第一)、成本效益更高、适合高频标准编码;Kimi K3擅长超长上下文真实利用、多模态输入(支持图片)、前端编码。最实用的策略是分层调用:高频编码和安全审查用GLM-5.3,需要多模态或超长上下文的复杂任务用Kimi K3。

GLM-5.3什么时候开源,能本地部署吗?

智谱官方在API上线当日(2026年8月19日)表示模型权重将于"下周五开源",遵循Kimi K3 License或智谱类似协议。开源后可通过HuggingFace获取权重进行本地部署。7530亿参数规模在推理资源需求上低于Kimi K3的2.8T,本地部署的门槛相对更低。

旧代码从GLM-5.2切换时会报什么错误?

最常见的报错是将thinking.type设为"disabled"——GLM-5.3不接受此值,请求会直接失败。检查所有调用点的thinking配置,统一改为"enabled";同时建议在测试环境验证reasoning_effort各档位的输出质量和成本,再推广到生产。


总结

GLM-5.3(智谱AI,2026年8月14日发布,8月19日API上线)在编程和网络安全两个方向实现了可量化的跃升:DeepSWE v1.1从46.2升至66.9,Terminal-Bench 3.0从4.6升至28.3,CyberGym 84.5%在所有参测模型中排名第一。定价与GLM-5.2保持一致,夜间和周末非高峰时段成本减半。接入方面,最重要的迁移注意事项是thinking.type必须改为"enabled",并按场景显式设置reasoning_effort档位避免默认max产生不必要成本。模型权重计划于近期开源,本地部署门槛低于同级别2.8T参数模型。

本文数据来源:Z.ai官方GLM-5.3文档(docs.z.ai,2026年8月)、BigModel开放平台文档(docs.bigmodel.cn,2026年8月)、Artificial Analysis基准测试(2026年8月19日,181个模型对比)、智谱AI官方发布(2026年8月14日)、DoNews报道《智谱GLM-5.3 API正式上线》(2026年8月19日)。


延伸阅读