发布日期:2026-09-03 | 数据口径:各厂商 Hugging Face 模型卡(截至 2026-09-03)

国产编程模型在 2026 年夏天集中换代,MiniMax M3、月之暗面 Kimi K3、DeepSeek-V4-Pro-0813 和智谱 GLM-5.3 四款开放权重模型先后上线,全部支持 100 万 Token 上下文,并把竞争焦点从"补全代码"转向"独立完成长任务"的 Agentic 编程。按各家模型卡公布的数据,GLM-5.3 在 Terminal Bench 2.1 和 DeepSWE 上拿到开源最高分,Kimi K3 以 2.8 万亿参数和最全的榜单覆盖领跑综合能力,DeepSeek-V4-Pro-0813 在 Agent 任务上较预览版大幅提升且采用 MIT 协议,MiniMax M3 靠稀疏注意力把百万上下文的推理成本压到最低。本文梳理四款模型的架构、实测成绩与定价差异,并给出用一把密钥同时接入四个模型、按任务切换的实操方法。


这个夏天国产模型为什么扎堆发新版

四款模型的发布时间挤在了三个月内。按 Hugging Face 模型库的记录,MiniMax M3 在 6 月初上传,Kimi K3 在 6 月中旬开源,DeepSeek-V4-Pro-0813 在 8 月 13 日发布正式版,GLM-5.3 在 8 月 25 日上传、月底正式对外。

它们的目标也惊人地一致。四家的模型卡都不再强调 HumanEval 这类单函数补全,而是把 Terminal Bench、DeepSWE、SWE-Marathon 这些"让模型自己在终端里跑几个小时、改完一个真实仓库"的基准放在最前面。智谱给 GLM-5 技术报告起的标题就叫"从 Vibe Coding 到 Agentic Engineering",很能代表这一轮的共识:比谁能写一段代码已经没有意义,比的是谁能独立把活干完。

另一个共同点是 100 万 Token 上下文成了标配。四款模型全部原生支持 1M 上下文,其中 Kimi K3 和 MiniMax M3 还是原生多模态,可以直接看截图和视频。对编程场景来说,这意味着整个中型仓库可以一次塞进上下文,不用再靠检索拼凑。

四款模型各自押注了什么

Kimi K3 押的是规模。 总参数 2.8 万亿,每个 Token 激活 1040 亿,896 个专家里选 16 个,注意力层用 69 层 KDA 加 24 层门控 MLA 的混合结构,权重以 MXFP4 量化感知训练得到。它是四款里参数最大、公布基准最多的一个,模型卡里连 BrowseComp、OSWorld、金融法律类 Agent 测试都列全了。

MiniMax M3 押的是效率。 总参数约 4280 亿、激活约 230 亿,核心是自研的 MiniMax Sparse Attention。官方数据是在 100 万上下文下,预填充速度比 M2 快 9 倍、解码快 15 倍,单 Token 计算量降到二十分之一。它还提供 enabled、adaptive、disabled 三档推理模式,可以在延迟和质量之间自己选。

DeepSeek-V4-Pro-0813 押的是 Agent 能力和开放度。 它是 V4 Pro 的正式版,总参数约 1.6 万亿、激活约 490 亿,采用 MIT 协议。模型卡把它和自家预览版并排对比:Terminal Bench 2.1 从 72.1 提到 87.9,DeepSWE 从 12.8 提到 62.7,几乎是重做了一遍后训练。配套的 DeepSeek Harness 和 DSpark 投机解码也一起开放。

GLM-5.3 押的是后训练。 智谱明确说它和 GLM-5.2 用的是同一个底座,所有提升都来自后训练,内部 Z.ai Code Bench 上的编程体感提升 50%。同期发布的 GLM-5.3-Flash 是 3200 亿总参数、180 亿激活的轻量版,原生多模态,采用 MIT 协议。

榜单成绩摆在一起看

各家的数字来自自己的评测框架,Kimi K3 用 Kimi Code、GLM-5.3 在 Claude Code 2.1.207 环境跑、DeepSeek 用自家 Harness,横向比较只能看大致档位。下表取每款模型自己模型卡里的成绩,MiniMax M3 的官方页面只放了图表没有数值,所以留空。

基准

Kimi K3

DeepSeek-V4-Pro-0813

GLM-5.3

MiniMax M3

Terminal Bench 2.1

88.3

87.9

88.8

未公布数值

DeepSWE

67.5

62.7

72.7

未公布数值

SWE-Marathon

42.0

未测

42.5

未公布数值

Agents' Last Exam

28.3

25.7

28.6

未公布数值

Toolathlon-Verified

76.5

74.1

73.0

未公布数值

几个值得注意的点。Terminal Bench 2.1 三家已经挤在 88 分上下,差距在误差范围内,这个榜快被刷平了。真正拉开差距的是 DeepSWE 和智谱新加的 Terminal Bench 3.0,GLM-5.3 在后者拿 34.6 分,同表里的 GLM-5.2 只有 4.6 分,Kimi K3 是 17.4 分。工具调用类的 Toolathlon 反过来是 Kimi K3 领先。DeepSeek-V4-Pro-0813 单看绝对分数不是最高,但它和 GLM-5.3 在各自表格里都列了海外旗舰模型的成绩,差距普遍在 1 到 5 分以内,这是一年前不敢想的。

MiniMax M3 的官方页面给出的可查数字是 BrowseComp 83.5 分和 PostTrainBench 37.1 分,编程部分只写了"世界领先",另外展示了两个长任务案例:一次约 12 小时的论文复现和一次约 24 小时、1959 次工具调用的 CUDA 内核优化,把 FP8 GEMM 的算力利用率从 7.6% 提到 71.3%。

实操:一把密钥同时接四个模型

四款模型各自开通账号、各自配 SDK 是最累的部分。国内可直接访问的七牛云 AI 大模型广场把这四款模型都收录了,开发者用一把 API Key、同一个 OpenAI 兼容接口就能全部调到,切换只需要改 model 字段。企业团队则有按月订阅的 Token Plan 套餐,一把密钥覆盖 DeepSeek、Kimi、GLM、MiniMax 四个厂商共 16 个模型,接口同时兼容 OpenAI 和 Anthropic 两种格式。下面以开发者账号为例。

第一步,装 SDK 并配好密钥。 在该平台控制台创建 API Key,写进环境变量。

pip install openai
export QINIU_API_KEY="你的密钥"

第二步,写一个可以切换模型的调用函数。 四个模型 ID 分别是 minimax/minimax-m3moonshotai/kimi-k3deepseek/deepseek-v4-pro-0813z-ai/glm-5.3

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.qnaigc.com/v1",
    api_key=os.environ["QINIU_API_KEY"],
)

MODELS = {
    "minimax": "minimax/minimax-m3",
    "kimi": "moonshotai/kimi-k3",
    "deepseek": "deepseek/deepseek-v4-pro-0813",
    "glm": "z-ai/glm-5.3",
}

def ask(vendor: str, prompt: str) -> str:
    resp = client.chat.completions.create(
        model=MODELS[vendor],
        messages=[{"role": "user", "content": prompt}],
        temperature=1.0,
    )
    return resp.choices[0].message.content

task = "用 Python 写一个带重试和指数退避的 HTTP 下载函数,附单元测试。"
for vendor in MODELS:
    print(f"===== {vendor} =====")
    print(ask(vendor, task)[:800])

第三步,按任务类型路由。 同一个提示词跑四遍看输出差异,是最直接的评测方式。跑完之后可以把规则固定下来:长时间的仓库级改动交给 GLM-5.3 或 Kimi K3,需要大量工具调用的自动化流程交给 Kimi K3,对成本敏感的批量生成任务交给 MiniMax M3,需要 MIT 协议或者要接 DeepSeek Harness 生态的交给 DeepSeek-V4-Pro-0813。

第四步,接进编程工具。 上面的接口地址和模型 ID 可以直接填进主流 AI 编程工具的自定义模型配置里,OpenAI 兼容格式的工具都能识别。MiniMax 官方页面也列出了 M3 已适配的工具清单,包括 Claude Code、Codex CLI、Cursor、Cline、OpenCode 等,其余三款模型的接法相同。

第五步,核一下成本。 以该平台 9 月 3 日的标价换算成每百万 Token:MiniMax M3 输入 2.1 元、输出 8.4 元;GLM-5.3 输入 8 元、输出 28 元;DeepSeek-V4-Pro-0813 高峰期输入 9 元、输出 27 元,低谷期减半;Kimi K3 输入 20 元、输出 100 元。四款模型都支持缓存命中折扣,缓存后的输入价格普遍只有原价的十分之一到五分之一,长对话和 Agent 循环里把系统提示词固定住,省下的钱比换模型还多。

写在最后

四款模型没有一个能在所有场景通吃。GLM-5.3 是当下开源编程基准的第一梯队,Kimi K3 综合能力和工具调用最强但价格高一档,DeepSeek-V4-Pro-0813 胜在协议宽松和生态开放,MiniMax M3 是百万上下文里最省钱的选择。它们与海外旗舰的差距已经缩小到几分之内,而价格只有对方的几分之一到十几分之一。

评测数据全部来自各厂商 2026 年 8 月至 9 月发布的模型卡,横向数字受评测框架影响,正式选型前建议用自己的仓库和真实任务复测一遍。

延伸阅读