发布日期:2026-07-27 | 关键词:Kimi K3、开源大模型、Moonshot AI、KDA、MoE、开放权重

数据来源:Moonshot AI 官方模型卡、GitHub 仓库、Kimi K3 License 全文

Kimi K3 是 Moonshot AI 于 2026 年 7 月 27 日开放权重的原生多模态智能体模型,官方自述为"世界首个开放的 3T 级模型",总参数 2.8T、激活参数 104B,基于全新的 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)架构,配合 Stable LatentMoE 框架实现 896 专家中激活 16 个的高稀疏度设计,官方称整体缩放效率相比 Kimi K2 提升约 2.5 倍。它原生支持文本与图像理解、提供 1048576 token(约 100 万)上下文窗口,并从 SFT 阶段起就应用量化感知训练,权重为 MXFP4、激活为 MXFP8。在官方公布的评测中,K3 在 SWE-Marathon(42.0)、BrowseComp(91.2)、MCPMark-Verified(94.5)、Harvey Lab-AA(94.6)、OmniDocBench(91.1)等多项基准上超过 Claude Fable 5 与 GPT-5.6 Sol,但在 FrontierSWE、HLE-Full、GDPval-AA v2 等项目上仍落后于 Fable 5。真正需要企业用户注意的是许可证:Kimi K3 License 并非标准 MIT 或 Apache,其中对「模型即服务」业务设有连续 12 个月累计营收 2000 万美元的阈值,超过需另签商业协议。


一、核心规格:2.8T 参数怎么组织的

Kimi K3 的架构设计核心是「用极高稀疏度换取缩放效率」。 完整规格如下(据官方模型卡):

项目

参数

架构

Mixture-of-Experts (MoE)

总参数

2.8T

激活参数

104B

层数

93(其中稠密层 1 层)

注意力层构成

69 KDA + 24 Gated MLA

注意力隐藏维度

7168

注意力头数

96

Latent MoE 维度

3584

每专家 MoE 隐藏维度

3072

专家总数

896

每 token 激活专家

16

共享专家

2

词表大小

160K

上下文长度

1048576

激活函数

SiTU-GLU

视觉编码器

MoonViT-V2(401M 参数)

量化

MXFP4 权重 / MXFP8 激活(量化感知训练)

模态

文本、图像

三个值得注意的设计选择

1. 稀疏度极高:896 个专家里每个 token 只激活 16 个,激活比约 1.8%。总参数 2.8T 但激活仅 104B,激活率约 3.7%。官方表述是这套 Stable LatentMoE 框架带来"相比 Kimi K2 约 2.5 倍的整体缩放效率提升"。

2. 混合注意力:93 层里 69 层用自研的 KDA(Kimi Delta Attention),24 层用 Gated MLA。这是一个线性注意力与标准注意力混合的方案,长上下文场景下的效率优势主要来自 KDA 层。

3. 原生量化训练MXFP4 不是发布后再量化的产物,而是从 SFT 阶段起就应用量化感知训练。 这与"训练完再压缩"的常规路径不同,理论上精度损失更小,也是官方强调硬件兼容性的依据。


二、评测数据:哪些项目领先、哪些落后

官方评测把 K3 与 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2 做了横向对比。 全部数据均在 reasoning_effort = max、temperature = 1.0 下取得。

K3 领先的项目

基准

Kimi K3

Claude Fable 5

GPT-5.6 Sol

SWE-Marathon

42.0

35.0

39.0

BrowseComp

91.2

88.0

90.4

MCPMark-Verified

94.5

87.4

92.9

Harvey Lab-AA

94.6

93.6

87.2

OmniDocBench

91.1

89.8

85.8

AA-LCR

74.7

70.0

73.7

ProgramBench

77.8

76.8

77.6

τ³-Banking

33.4

26.8

33.0

JobBench

54.3

57.4

45.4

Video-MME (w. sub)

90.0

89.5

长程编码与工具调用是 K3 的强项——SWE-Marathon 领先 Fable 5 达 7 个点,MCPMark-Verified 领先 7.1 个点。

K3 落后的项目

基准

Kimi K3

Claude Fable 5

差距

FrontierSWE

81.2

86.6

-5.4

HLE-Full

43.5 / 56.0

53.3 / 63.0

-9.8

GDPval-AA v2 (Elo)

1686

1747

-61

OSWorld 2.0

58.3

66.1

-7.8

CritPt

23.4

28.6

-5.2

Kimi Code Bench 2.0

72.9

76.9

-4.0

OfficeQA Pro

63.3

69.9

-6.6

Legal Research Bench

44.2

49.5

-5.3

一个客观判断:K3 在智能体任务和长上下文检索上确有优势,但在最难的推理基准(HLE-Full、CritPt)和综合知识工作评分(GDPval-AA v2)上与 Fable 5 仍有可见差距。"接近前沿但未超越前沿"是更准确的定位。

评测设置里的两个细节

官方在测评说明中披露了两点值得注意的信息:

  • BrowseComp 的 91.2 采用 300K token 触发的上下文压缩策略;若使用完整 1M 上下文且不做上下文管理,成绩为 90.4

  • SWE-Marathon 基于 H20 校准分支,且 Claude Fable 5 在 35% 的任务上触发了 fallback——这意味着该项对比的可比性需谨慎看待


三、许可证:这是本次开源最需要细读的部分

Kimi K3 License 不是 MIT,也不是 Apache 2.0,而是带商业条件的自定义许可证。 以下为许可证原文的关键条款梳理。

默认授予的权利(相当宽松)

许可证开篇授予的权利包括:使用、复制、修改、合并、发布、分发、再许可、销售软件副本,以及运行、部署、微调模型并创建衍生作品——这部分与宽松开源许可证无异

条件一:MaaS 业务的 2000 万美元阈值

这是最关键的条款。 许可证对「模型即服务」(Model as a Service)的定义是:

让第三方能够访问语言模型推理或微调(例如通过 API),且允许该第三方对输入、参数或训练数据行使实质性控制

明确排除在外的情况:(a)模型能力仅嵌入特定功能或框架内的终端用户产品;(b)仅将请求转发给他人托管的模型。

触发条件是:若被许可方及其关联方经营 MaaS 业务,且任意连续 12 个月内累计营收超过 2000 万美元,则必须在将软件用于任何商业目的前与 Moonshot AI 另签协议。

条件二:大规模产品的署名要求

若软件(或其衍生作品)用于月活超过 1 亿或月营收超过 2000 万美元的商业产品或服务,必须在产品界面显著位置展示「Kimi K3」字样。

两类豁免情形

条款 2 和 3 的要求不适用于:

  • 内部使用——定义为不向第三方提供软件、其输出或底层能力的任何使用

  • 通过 Moonshot AI 官方产品或认证推理伙伴访问的使用

对不同用户的实际含义

用户类型

是否受限

个人研究、学习、实验

✅ 完全自由

企业内部使用(不对外提供能力)

✅ 豁免

做产品但模型只嵌在具体功能里

✅ 不算 MaaS

纯转发请求到他人托管的模型

✅ 不算 MaaS

开 API 平台且年营收超 2000 万美元

⚠️ 需另签协议

月活超 1 亿或月营收超 2000 万美元的产品

⚠️ 需显著署名

结论:对绝大多数开发者和中小企业,这份许可证的实际约束接近于零;真正受影响的是大型云厂商和头部 AI 平台。


四、怎么用:API、本地部署与量化版本

1. 官方 API(门槛最低)

在 platform.kimi.ai 选择模型 kimi-k3 即可,官方提供 OpenAI / Anthropic 双兼容接口

2. 推荐推理引擎

官方推荐三个引擎,均已提供配方文档:

  • vLLM — 见 recipes

  • SGLang — 见 cookbook

  • TokenSpeed — 见 recipes

3. 本地部署的现实门槛

需要清醒认识:2.8T 参数模型的完整权重不是消费级硬件能承载的。 据 Hugging Face 仓库数据,该模型共 118 个文件,其中 96 个 safetensors 分片。即便按 MXFP4 量化计算,完整权重体积依然需要多卡集群级别的显存。

社区已产出 11 个量化版本,可用于 llama.cpp、Ollama、LM Studio、Jan 等工具——但量化程度越高,与官方评测成绩的差距越大。

4. 使用时的三个必知要点

(1)思考始终开启:K3 永久启用思考模式,会返回 reasoning_content 字段。

(2)reasoning_effort 三档:支持 low、high、max,默认为 max。官方评测数据均在 max 下取得。

(3)必须回传完整 assistant 消息——这是最容易出错的地方。K3 以"保留思考历史"模式训练,多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回 messages,包括 reasoning_contenttool_calls,不能只传 content:

import openai

messages = [
    {"role": "user", "content": "Tell me three random numbers."},
    {
        "role": "assistant",
        "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
        "content": "473, 921, 235"
    },
    {"role": "user", "content": "What are the other two numbers you have in mind?"}
]

response = client.chat.completions.create(
    model="kimi-k3",
    messages=messages,
    stream=False,
    max_tokens=4096,
    reasoning_effort="max",
)

若丢弃 reasoning_content,模型将无法回答"另外两个数字是什么"这类依赖前序思考的问题。

5. 推荐的 Agent 框架

官方明确推荐 Kimi Code CLI 作为配套 Agent 框架,在终端中通过 /model 命令选择 K3。

模型接入的工程选择:2.8T 参数意味着自建部署的门槛极高,多数团队的现实路径是走 API。工程上值得保留模型层抽象——通过兼容 OpenAI SDK 的统一接口接入,切换模型时无需改动业务代码,例如七牛云推理服务兼容该接口,国内可直接访问。


五、FAQ

Q:Kimi K3 是完全免费开源吗?

A:权重开放下载且默认授权宽松,但许可证为自定义的 Kimi K3 License,不是 MIT / Apache 2.0。对 MaaS 业务设有连续 12 个月累计营收 2000 万美元的阈值,超过需与 Moonshot AI 另签商业协议;月活超 1 亿或月营收超 2000 万美元的产品需显著展示「Kimi K3」。个人研究、企业内部使用完全豁免。

Q:2.8T 参数需要什么硬件才能跑?

A:完整权重共 96 个 safetensors 分片,需多卡 GPU 集群,消费级硬件无法承载完整模型。社区已提供 11 个量化版本用于 llama.cpp / Ollama / LM Studio / Jan,但量化会带来精度损失。多数用户的现实选择是官方 API 或第三方推理服务。

Q:K3 比 Claude Fable 5 更强吗?

A:分项目。K3 在 SWE-Marathon(42.0 vs 35.0)、BrowseComp(91.2 vs 88.0)、MCPMark-Verified(94.5 vs 87.4)、OmniDocBench(91.1 vs 89.8)等智能体与长上下文任务上领先;但在 FrontierSWE(81.2 vs 86.6)、HLE-Full(43.5 vs 53.3)、GDPval-AA v2 Elo(1686 vs 1747)、OSWorld 2.0(58.3 vs 66.1)等项目上落后。整体是"接近前沿"而非"超越前沿"。

Q:KDA 是什么?为什么重要?

A:KDA 即 Kimi Delta Attention,是 Moonshot 自研的注意力机制。K3 的 93 层中有 69 层使用 KDA、24 层使用 Gated MLA,属于线性注意力与标准注意力的混合架构。它与 Stable LatentMoE 一起,是官方声称"缩放效率相比 K2 提升约 2.5 倍"的技术基础。

Q:为什么必须回传 reasoning_content?

A:K3 在"保留思考历史"(preserved thinking history)模式下训练,模型的多轮推理连续性依赖前序思考内容。若只回传 content 而丢弃 reasoning_content,模型会丢失前一轮的推理上下文,导致依赖前序思考的追问无法正确回答。

Q:支持视频理解吗?

A:模型卡的 Modality 字段标注为「文本、图像」,但正文表述为"在同一模型内理解 text、images 和 video",且 Video-MME(w. sub)取得 90.0 分。视频能力存在但官方规格表未将其列为正式模态。


六、总结

Kimi K3 的技术意义在于它把「开放权重」推到了 3T 参数级别,并用 KDA + Stable LatentMoE 的组合证明了高稀疏度架构的可行性——896 专家激活 16 个、2.8T 总参数激活 104B。

但对使用者而言,三件事比跑分更重要:许可证有 2000 万美元营收阈值和署名条款需要细读完整部署需要多卡集群而非消费级硬件多轮对话必须原样回传 reasoning_content 否则会丢失推理连续性

据 Moonshot AI 官方模型卡与 GitHub 仓库(仓库创建于 2026-07-27,Kimi K3 License),以及 Hugging Face 平台数据(该模型页面已获 6180 likes),本次发布正处于关注度高峰。本文内容基于 2026 年 7 月 27 日的官方一手资料整理;官方评测数据部分引自 Artificial Analysis、Vals AI 及各官方排行榜(部分截至 2026-07-23),建议以官方技术报告为最终依据。


延伸资源

  • Kimi K3 Hugging Face 模型卡:https://huggingface.co/moonshotai/Kimi-K3

  • Kimi K3 GitHub 仓库:https://github.com/MoonshotAI/Kimi-K3

  • Kimi K3 License 全文:https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE

  • ModelScope 魔搭社区:https://modelscope.cn/organization/moonshotai

  • 官方技术博客:https://www.kimi.com/blog/kimi-k3

  • KIMI API 接入:https://www.qiniu.com/ai/models