2026 年 7-8 月,三款国产旗舰模型密集发布:月之暗面 Kimi K3(7 月 16 日发布、7 月 27 日开源,2.8T 参数)、阿里 Qwen3.8-Max(8 月 3 日正式版,2.4T 参数)、DeepSeek V4 系列(V4-Flash 7 月 31 日正式版、V4-Pro 1.6T)。三者都奔着「全球前三」的位置去,都支持百万 token 上下文,都有开源版本。但参数量之外,它们在架构创新、实测编程能力、定价和适用场景上的差距,才是选型真正该看的东西。本文基于官方技术报告和第三方独立评测,从参数架构、编程能力、价格成本、场景匹配四个维度拆解三款模型,给出不同用量结构下的选型建议。

 

三款模型基础参数速览

参数

Kimi K3

Qwen3.8-Max

DeepSeek V4-Pro

DeepSeek V4-Flash

发布时间

2026-07-16

2026-08-03

2026-04-24

2026-04-24(正式版 07-31)

总参数量

2.8T

2.4T

1.6T

284B

激活参数

104B

约 95B

49B

13B

架构

MoE + KDA 混合线性注意力

MoE + 混合注意力

MoE

MoE

上下文窗口

1M tokens

1M tokens

1M tokens

1M tokens

多模态

✓ 图文视频

✓ 图文视频

✗ 纯文本

✗ 纯文本

开源状态

已开源(2026-07-27)

下周开源(预计 08-10)

已开源(MIT)

已开源(MIT)

四款模型全部支持百万 token 上下文,这已经成为旗舰级别的标配门槛而非差异点。真正的差异在激活参数、架构创新和实测能力。

 

架构:三家各自在哪里押注

Kimi K3:KDA 机制重写注意力

Kimi K3 的核心架构创新是 KDA(Kimi Delta Attention)混合线性注意力机制,结合注意力残差(Attention Residuals)技术。

标准 Transformer 注意力的计算复杂度随序列长度平方增长,处理百万 token 时资源消耗极高。KDA 把注意力运算分成两路——高频局部注意力(精确但计算密集)+ 低频全局线性近似(廉价但覆盖广),加权组合后在保持精度的同时把长序列的计算量压下来。月之暗面同步开源了支撑 K3 训练的关键基础设施:MoonEP(训练框架)、FlashKDA(注意力算子优化)、AgentEnv(Agent 训练环境)。

激活参数 104B——三款模型里最高,意味着单次推理的「思考密度」最强。

Qwen3.8-Max:混合注意力 + 大规模后训练

Qwen3.8-Max 的架构创新点是混合注意力机制,结合标准 Multi-Head Attention 和线性注意力,兼顾长序列精度和效率,在 1M token 上下文下不会因长度显著降速。

技术上更值得关注的是后训练:官方明确说明模型架构和前代相同,仅重新进行了后训练(从预览版到正式版的提升路径)。这与 DeepSeek V4-Flash 正式版的逻辑类似——同样架构,靠后训练拔高实测能力。

DeepSeek V4:双轨策略,极致成本分工

DeepSeek V4 系列走的是 Pro + Flash 双轨并行策略:V4-Pro(1.6T/49B 激活)面向高难度推理,V4-Flash(284B/13B 激活)面向高频低成本场景。两者关键区别是 V4-Flash 正式版原生支持 Responses API,Codex 等 Agent 工具可以直接接入不需要适配层。V4-Pro 的 Responses API 支持也在 8 月初跟进。

 

编程能力:有数的 Benchmark 和没数的现实

有数字的

Benchmark

Kimi K3

DeepSeek V4-Pro

Qwen3.8-Max

SWE-bench Verified

[K3 官方未公布标准分]

~80.6%

[官方未公布]

FrontierSWE

81.2%

Terminal Bench 2.1

88.3

SWE Marathon

第一(绝对分未公布)

DeepSeek V4-Pro 在 SWE-bench Verified 的约 80.6% 是目前三款里有可查来源的最高标准化跑分。Kimi K3 的 FrontierSWE 81.2% 和 Terminal Bench 88.3 来自开源后的社区测试,覆盖了高难度软件工程场景,与 GPT-5.6 Sol 接近;但 Kimi K3 没有公布 SWE-bench Verified 标准得分,跨模型横比有局限。

Qwen3.8-Max 截至发布日未公布标准化 Benchmark 成绩,官方口径「第三方榜单仅次于 Claude」基于主观盲测,不等同于经审计的客观基准。

没数字但有案例的

Kimi K3:48 小时内完成 45nm 推理芯片原型设计(含 146 万标准单元、0.277MB SRAM),FireworksAI 第三方评测在 1030 个真实 Agent 任务里,Kimi K3 在 SWE-bench 类任务上表现接近 Claude Fable 5,成本约为其 1/50。

Qwen3.8-Max:16 天自主完成 Hermes Agent 完整框架(从架构设计到调试迭代,265 次 commits、127 个 PR)。

DeepSeek V4-Flash:原生 Responses API 支持让 Codex 无适配层直连,是目前接入 AI 编程工具链成本最低的路线。

 

 

价格:差距超过 50 倍

模型

输入(缓存未命中)

输入(缓存命中)

输出

DeepSeek V4-Flash

1 元/百万

0.02 元/百万

2 元/百万

DeepSeek V4-Pro

3 元/百万

0.025 元/百万

6 元/百万

Qwen3.8-Max

约 14 元/百万(约 2 美元)

约 1.75 元/百万

约 43 元/百万(约 6 美元)

Kimi K3

20 元/百万

2 元/百万

100 元/百万

注:Qwen3.8-Max 为 QwenCloud 国际站美元标价换算,实际国内百炼定价可能不同;DeepSeek 高峰时段(工作日 9-12、14-18 点)按 2 倍执行。

核心差距:Kimi K3 输出 100 元,DeepSeek V4-Flash 输出 2 元,相差 50 倍。 同样是旗舰级模型,价格体系完全不同。

Kimi K3 的高定价对应的是:开源最大参数(2.8T)、最高激活参数(104B)、当前旗舰级别里实测编程能力靠前、缓存命中后输入降到 2 元/百万。对于输出量不大但精度要求高的任务(合同审查、高难度代码分析),成本压力可接受;对于 Agent 多轮调用这类输出密集场景,成本差距会被急剧放大。

 

开源状态与本地部署

模型

开源协议

权重状态

本地部署参考算力

Kimi K3

开源(协议待确认)

已发布(2026-07-27)

2.8T FP16 约需 5.6TB 显存

Qwen3.8-Max

开源(待发布)

下周(预计 08-10)

2.4T FP16 约需 4.8TB 显存

Qwen3.8-27B

Apache / MIT

下周同步开源

27B FP16 约 54GB,2 张 A100 可跑

DeepSeek V4-Flash

MIT

已发布

284B FP16 约 568GB

DeepSeek V4-Pro

MIT

已发布

1.6T FP16 约 3.2TB

消费级硬件实际可跑的是 Qwen3.8-27B(下周开源)和有量化版本的 DeepSeek V4-Flash(社区已有 Q4 量化版本可在 4 张 RTX 4090 运行)。三款 2T+ 模型的完整权重都超出消费级硬件范围。

同步开源的 Kimi 训练基础设施(MoonEP + FlashKDA + AgentEnv)对想做自主训练的研究团队价值更高——不只是权重,而是完整的训练工程体系。

 

四类场景的选型建议

场景一:AI 编程 Agent(Codex / Claude Code 工作流)

优先 DeepSeek V4-Flash

原因:原生 Responses API 支持,Codex 直连无需适配层;输出 2 元/百万 token,Agent 多轮调用成本最低;适合高频自动化的代码生成、审查、重构任务。追求更强推理能力可升级到 V4-Pro(6 元/百万输出)。

场景二:高难度软件工程任务(单个任务、精度优先)

优先 Kimi K3 或 DeepSeek V4-Pro

Kimi K3 在 FrontierSWE 81.2% 和 Terminal Bench 88.3 的实测成绩,说明在高难度任务上有竞争力;DeepSeek V4-Pro 有 SWE-bench Verified 约 80.6% 的可查标准化数据。两者适合单个任务精度要求极高但调用频次不高的场景(大型重构、复杂 Bug 修复)。若成本敏感,V4-Pro 远低于 Kimi K3。

场景三:超长文档处理(法律/金融/研究报告)

优先 Qwen3.8-Max 或 Kimi K3

两者都支持 1M 上下文,且都是多模态(图文视频)。Qwen3.8-Max 的 16 天 Agent 自主运行案例说明长程任务能力;Kimi K3 技术上激活参数更高,单次推理「思考量」更大。选择取决于定价接受度:Qwen3.8-Max 约 43 元/百万输出,Kimi K3 约 100 元/百万输出。

场景四:成本控制 + 多模型横向测试

优先 DeepSeek V4-Flash + 聚合平台统一接入

先用 V4-Flash 把基础工作流跑通(成本最低),再按任务类型测试 V4-Pro 和 Qwen3.8-Max 的质量差异,确定主力模型后再优化成本结构。使用七牛云 AI Token Plan(qiniu.com/ai/plan)可以一套 API Key 同时接入 DeepSeek V4 系列和 Kimi 系列,横向测试时不需要维护多套鉴权配置,切换只改 model 字段。

 

常见问题

Q:三款模型都说「全球前三」,到底谁更强?

定语不同,不能直接比较。Kimi K3 是「全球参数最大开源模型」(2.8T,规模第一);Qwen3.8-Max 是「第三方盲测仅次于 Claude」(综合能力主观排名);DeepSeek V4-Pro 是「SWE-bench Verified 约 80.6%」(客观标准化编程能力)。三个维度各有侧重,没有统一口径。最可靠的判断是拿自己的实际任务集跑对比测试。

Q:开源权重有什么实际用途?

三类用途:① 本地部署,数据不出内网(适合合规要求高的企业);② 基于权重微调,把通用模型调优到特定领域;③ 学术研究,分析模型架构和能力边界。DeepSeek V4 系列 MIT 协议最宽松,支持商业用途改造;Kimi K3 同步开源了训练框架,适合想做自主训练的团队。

Q:为什么 Qwen3.8-Max 发布了还没公布 Benchmark?

官方的选择。预览版发布时没有跑分,正式版发布时仍未公布。可能的原因是标准化跑分的测试流程需要时间,也可能是预期结果尚在优化中。对开发者来说,意味着目前只能依赖实测而非参考官方数据——建议用自己的任务集测试,不要只看第三方口径。

Q:100 万 token 上下文在实际场景中能放多少内容?

约 75 万英文单词或 50 万汉字,相当于:整本中篇小说全文、中型代码库(10-50 万行)的主要文件、数小时视频字幕、数百页法律合同。在 Agent 编程场景里,1M 上下文意味着可以把整个项目仓库放进上下文做分析,不需要手动切分文件。

 

小结

三款模型各有位置:DeepSeek V4-Flash 是 Agent 编程场景里成本最低的生产级选择,2 元/百万输出 + Codex 原生支持;Kimi K3 是当前开源权重最大的模型,FrontierSWE 和 Terminal Bench 的实测数据说明高难度任务上的竞争力,代价是最贵的输出定价;Qwen3.8-Max 的标准 Benchmark 数据尚未发布,但 16 天自主 Agent 案例和下周开源的计划是两个有实质意义的信号,正式跑分公布后值得重新评估排序。

没有哪款模型在所有维度上都领先。选型建议:先看成本结构(每天调用多少次、输出量多大),再看是否需要开源权重,最后用自己的任务集实测,不要只参考榜单口径。

数据来源:DeepSeek 官方技术报告(github.com/deepseek-ai/DeepSeek-V4,2026 年 4-7 月)、Kimi K3 官方发布公告及技术报告(2026 年 7 月)、Qwen3.8-Max 正式版公告(2026 年 8 月 3 日)、FireworksAI Kimi K3 实测报告(2026 年 7-8 月)、SWE-bench 官方榜单(swe-bench.github.io,2026 年 7-8 月)。

 

延伸阅读

 DeepSeek V4 技术报告与开源权重:github.com/deepseek-ai/DeepSeek-V4

 Kimi K3 开源仓库(权重 + 训练框架):github.com/MoonshotAI/Kimi-K3

 Qwen3.8-Max API 接入:qwencloud.com/models/qwen3.8-max

 七牛云 AI Token Plan(DeepSeek+Kimi 等多模型统一接入):https://www.qiniu.com/ai/plan