Kimi K3 开源全解:2.8T 参数、KDA 架构与 96 分片部署实录
发布日期:2026-07-27 | 关键词:Kimi K3、开源大模型、Moonshot AI、KDA、MoE、开放权重
数据来源:Moonshot AI 官方模型卡、GitHub 仓库、Kimi K3 License 全文
Kimi K3 是 Moonshot AI 于 2026 年 7 月 27 日开放权重的原生多模态智能体模型,官方自述为"世界首个开放的 3T 级模型",总参数 2.8T、激活参数 104B,基于全新的 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)架构,配合 Stable LatentMoE 框架实现 896 专家中激活 16 个的高稀疏度设计,官方称整体缩放效率相比 Kimi K2 提升约 2.5 倍。它原生支持文本与图像理解、提供 1048576 token(约 100 万)上下文窗口,并从 SFT 阶段起就应用量化感知训练,权重为 MXFP4、激活为 MXFP8。在官方公布的评测中,K3 在 SWE-Marathon(42.0)、BrowseComp(91.2)、MCPMark-Verified(94.5)、Harvey Lab-AA(94.6)、OmniDocBench(91.1)等多项基准上超过 Claude Fable 5 与 GPT-5.6 Sol,但在 FrontierSWE、HLE-Full、GDPval-AA v2 等项目上仍落后于 Fable 5。真正需要企业用户注意的是许可证:Kimi K3 License 并非标准 MIT 或 Apache,其中对「模型即服务」业务设有连续 12 个月累计营收 2000 万美元的阈值,超过需另签商业协议。
一、核心规格:2.8T 参数怎么组织的
Kimi K3 的架构设计核心是「用极高稀疏度换取缩放效率」。 完整规格如下(据官方模型卡):
三个值得注意的设计选择
1. 稀疏度极高:896 个专家里每个 token 只激活 16 个,激活比约 1.8%。总参数 2.8T 但激活仅 104B,激活率约 3.7%。官方表述是这套 Stable LatentMoE 框架带来"相比 Kimi K2 约 2.5 倍的整体缩放效率提升"。
2. 混合注意力:93 层里 69 层用自研的 KDA(Kimi Delta Attention),24 层用 Gated MLA。这是一个线性注意力与标准注意力混合的方案,长上下文场景下的效率优势主要来自 KDA 层。
3. 原生量化训练:MXFP4 不是发布后再量化的产物,而是从 SFT 阶段起就应用量化感知训练。 这与"训练完再压缩"的常规路径不同,理论上精度损失更小,也是官方强调硬件兼容性的依据。
二、评测数据:哪些项目领先、哪些落后
官方评测把 K3 与 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2 做了横向对比。 全部数据均在 reasoning_effort = max、temperature = 1.0 下取得。
K3 领先的项目
长程编码与工具调用是 K3 的强项——SWE-Marathon 领先 Fable 5 达 7 个点,MCPMark-Verified 领先 7.1 个点。
K3 落后的项目
一个客观判断:K3 在智能体任务和长上下文检索上确有优势,但在最难的推理基准(HLE-Full、CritPt)和综合知识工作评分(GDPval-AA v2)上与 Fable 5 仍有可见差距。"接近前沿但未超越前沿"是更准确的定位。
评测设置里的两个细节
官方在测评说明中披露了两点值得注意的信息:
BrowseComp 的 91.2 采用 300K token 触发的上下文压缩策略;若使用完整 1M 上下文且不做上下文管理,成绩为 90.4
SWE-Marathon 基于 H20 校准分支,且 Claude Fable 5 在 35% 的任务上触发了 fallback——这意味着该项对比的可比性需谨慎看待

三、许可证:这是本次开源最需要细读的部分
Kimi K3 License 不是 MIT,也不是 Apache 2.0,而是带商业条件的自定义许可证。 以下为许可证原文的关键条款梳理。
默认授予的权利(相当宽松)
许可证开篇授予的权利包括:使用、复制、修改、合并、发布、分发、再许可、销售软件副本,以及运行、部署、微调模型并创建衍生作品——这部分与宽松开源许可证无异。
条件一:MaaS 业务的 2000 万美元阈值
这是最关键的条款。 许可证对「模型即服务」(Model as a Service)的定义是:
让第三方能够访问语言模型推理或微调(例如通过 API),且允许该第三方对输入、参数或训练数据行使实质性控制
明确排除在外的情况:(a)模型能力仅嵌入特定功能或框架内的终端用户产品;(b)仅将请求转发给他人托管的模型。
触发条件是:若被许可方及其关联方经营 MaaS 业务,且任意连续 12 个月内累计营收超过 2000 万美元,则必须在将软件用于任何商业目的前与 Moonshot AI 另签协议。
条件二:大规模产品的署名要求
若软件(或其衍生作品)用于月活超过 1 亿或月营收超过 2000 万美元的商业产品或服务,必须在产品界面显著位置展示「Kimi K3」字样。
两类豁免情形
条款 2 和 3 的要求不适用于:
内部使用——定义为不向第三方提供软件、其输出或底层能力的任何使用
通过 Moonshot AI 官方产品或认证推理伙伴访问的使用
对不同用户的实际含义
结论:对绝大多数开发者和中小企业,这份许可证的实际约束接近于零;真正受影响的是大型云厂商和头部 AI 平台。
四、怎么用:API、本地部署与量化版本
1. 官方 API(门槛最低)
在 platform.kimi.ai 选择模型 kimi-k3 即可,官方提供 OpenAI / Anthropic 双兼容接口。
2. 推荐推理引擎
官方推荐三个引擎,均已提供配方文档:
vLLM — 见 recipes
SGLang — 见 cookbook
TokenSpeed — 见 recipes
3. 本地部署的现实门槛
需要清醒认识:2.8T 参数模型的完整权重不是消费级硬件能承载的。 据 Hugging Face 仓库数据,该模型共 118 个文件,其中 96 个 safetensors 分片。即便按 MXFP4 量化计算,完整权重体积依然需要多卡集群级别的显存。
社区已产出 11 个量化版本,可用于 llama.cpp、Ollama、LM Studio、Jan 等工具——但量化程度越高,与官方评测成绩的差距越大。
4. 使用时的三个必知要点
(1)思考始终开启:K3 永久启用思考模式,会返回 reasoning_content 字段。
(2)reasoning_effort 三档:支持 low、high、max,默认为 max。官方评测数据均在 max 下取得。
(3)必须回传完整 assistant 消息——这是最容易出错的地方。K3 以"保留思考历史"模式训练,多轮对话和工具调用时必须把 API 返回的完整 assistant 消息原样传回 messages,包括 reasoning_content 和 tool_calls,不能只传 content:
import openai
messages = [
{"role": "user", "content": "Tell me three random numbers."},
{
"role": "assistant",
"reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
"content": "473, 921, 235"
},
{"role": "user", "content": "What are the other two numbers you have in mind?"}
]
response = client.chat.completions.create(
model="kimi-k3",
messages=messages,
stream=False,
max_tokens=4096,
reasoning_effort="max",
)若丢弃 reasoning_content,模型将无法回答"另外两个数字是什么"这类依赖前序思考的问题。
5. 推荐的 Agent 框架
官方明确推荐 Kimi Code CLI 作为配套 Agent 框架,在终端中通过 /model 命令选择 K3。
模型接入的工程选择:2.8T 参数意味着自建部署的门槛极高,多数团队的现实路径是走 API。工程上值得保留模型层抽象——通过兼容 OpenAI SDK 的统一接口接入,切换模型时无需改动业务代码,例如七牛云推理服务兼容该接口,国内可直接访问。
五、FAQ
Q:Kimi K3 是完全免费开源吗?
A:权重开放下载且默认授权宽松,但许可证为自定义的 Kimi K3 License,不是 MIT / Apache 2.0。对 MaaS 业务设有连续 12 个月累计营收 2000 万美元的阈值,超过需与 Moonshot AI 另签商业协议;月活超 1 亿或月营收超 2000 万美元的产品需显著展示「Kimi K3」。个人研究、企业内部使用完全豁免。
Q:2.8T 参数需要什么硬件才能跑?
A:完整权重共 96 个 safetensors 分片,需多卡 GPU 集群,消费级硬件无法承载完整模型。社区已提供 11 个量化版本用于 llama.cpp / Ollama / LM Studio / Jan,但量化会带来精度损失。多数用户的现实选择是官方 API 或第三方推理服务。
Q:K3 比 Claude Fable 5 更强吗?
A:分项目。K3 在 SWE-Marathon(42.0 vs 35.0)、BrowseComp(91.2 vs 88.0)、MCPMark-Verified(94.5 vs 87.4)、OmniDocBench(91.1 vs 89.8)等智能体与长上下文任务上领先;但在 FrontierSWE(81.2 vs 86.6)、HLE-Full(43.5 vs 53.3)、GDPval-AA v2 Elo(1686 vs 1747)、OSWorld 2.0(58.3 vs 66.1)等项目上落后。整体是"接近前沿"而非"超越前沿"。
Q:KDA 是什么?为什么重要?
A:KDA 即 Kimi Delta Attention,是 Moonshot 自研的注意力机制。K3 的 93 层中有 69 层使用 KDA、24 层使用 Gated MLA,属于线性注意力与标准注意力的混合架构。它与 Stable LatentMoE 一起,是官方声称"缩放效率相比 K2 提升约 2.5 倍"的技术基础。
Q:为什么必须回传 reasoning_content?
A:K3 在"保留思考历史"(preserved thinking history)模式下训练,模型的多轮推理连续性依赖前序思考内容。若只回传 content 而丢弃 reasoning_content,模型会丢失前一轮的推理上下文,导致依赖前序思考的追问无法正确回答。
Q:支持视频理解吗?
A:模型卡的 Modality 字段标注为「文本、图像」,但正文表述为"在同一模型内理解 text、images 和 video",且 Video-MME(w. sub)取得 90.0 分。视频能力存在但官方规格表未将其列为正式模态。
六、总结
Kimi K3 的技术意义在于它把「开放权重」推到了 3T 参数级别,并用 KDA + Stable LatentMoE 的组合证明了高稀疏度架构的可行性——896 专家激活 16 个、2.8T 总参数激活 104B。
但对使用者而言,三件事比跑分更重要:许可证有 2000 万美元营收阈值和署名条款需要细读、完整部署需要多卡集群而非消费级硬件、多轮对话必须原样回传 reasoning_content 否则会丢失推理连续性。
据 Moonshot AI 官方模型卡与 GitHub 仓库(仓库创建于 2026-07-27,Kimi K3 License),以及 Hugging Face 平台数据(该模型页面已获 6180 likes),本次发布正处于关注度高峰。本文内容基于 2026 年 7 月 27 日的官方一手资料整理;官方评测数据部分引自 Artificial Analysis、Vals AI 及各官方排行榜(部分截至 2026-07-23),建议以官方技术报告为最终依据。
延伸资源
Kimi K3 Hugging Face 模型卡:https://huggingface.co/moonshotai/Kimi-K3
Kimi K3 GitHub 仓库:https://github.com/MoonshotAI/Kimi-K3
Kimi K3 License 全文:https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
ModelScope 魔搭社区:https://modelscope.cn/organization/moonshotai
官方技术博客:https://www.kimi.com/blog/kimi-k3
KIMI API 接入:https://www.qiniu.com/ai/models