阿里巴巴通义千问团队于 2026 年 8 月 3 日正式发布 Qwen3.8-Max,参数量达 2.4 万亿(2.4T),采用 MoE 稀疏激活架构,激活参数约 95B,是 Qwen 家族迄今规模最大的模型,也是全球开源模型中第二个参数规模突破 2T 的版本。官方称其在编程(Coding)和专业办公(Cowork)两个核心方向全面升级,第三方盲测榜单综合能力仅次于 Claude。模型权重将于下周开源,届时同步开源 Qwen3.8-27B;目前 API 已正式上线,支持图像、视频、文档与文本全模态输入,上下文窗口达 100 万 token。

  

今天发布了什么

2026 年 8 月 3 日,阿里巴巴通义千问正式发布 Qwen3.8-Max 正式版。这不是新模型,而是今年 7 月 19 日上线的 Qwen3.8-Max-Preview 预览版的正式版本——同一套架构,经过系统性后训练迭代,稳定性和综合能力显著提升。

同步宣布的关键信息:

 下周开源模型权重:Qwen3.8-Max 将成为千问历史上首个开源的 Max 级权重版本,同步开源 Qwen3.8-27B 稠密模型

 千问办公开启公测:面向非开发者的 AI 办公智能体产品,搭载 Qwen3.8-Max 同步开放

 API 正式上线:可通过阿里云百炼、QwenCloud、Qoder 等平台调用,不再是预览限流状态

从预览版到正式版的核心变化,官方的描述是:以「天」为单位持续迭代,编程和前端开发能力提升尤为明显。

 

架构:2.4T 参数、95B 激活、100 万上下文

Qwen3.8-Max 是目前千问系列规模最大的模型,核心架构参数:

参数

数值

总参数量

2.4 万亿(2.4T)

激活参数

约 95B

上下文窗口

1M tokens(约 100 万)

最大输入

991K tokens

最大输出

131K tokens

推理思维链上限

262K tokens

MoE 稀疏架构的意义在于:总参数 2.4T,每次推理只激活约 95B,运算量接近 100B 级稠密模型,但拥有更大参数量带来的知识容量和泛化能力。这也是为什么模型在保持推理效率的同时,能覆盖法律、金融、设计等数百个专业领域任务。

架构上与上一代的核心升级点是混合注意力机制——结合了标准 Multi-Head Attention 与线性注意力,在处理超长文档(100 万 token 量级)时兼顾精度和效率,不会因为上下文过长而显著降速。

 

能力亮点:16 天自主编程搓出一个 Hermes Agent

官方最具冲击力的演示案例是:Qwen3.8-Max 在 16 天内自主完成了一个完整 AI 编程框架(Hermes Agent)的编写——从需求分析、架构设计、代码实现到调试迭代,全程无人工介入,最终产出可运行的完整项目。

这是在说一件具体的事:长程自主执行能力。AI 不只是写代码片段,而是能在「目标→规划→执行→反馈→修正」的循环中持续工作十几天,覆盖跨越多个模块的完整工程任务。这正是 Qwen3.8 定义的核心升级方向——不是在单题 Benchmark 上多一两个百分点,而是在真实工程任务中能端到端跑通。

其他能力亮点:

 原生全模态:千问首个 Max 级别同时支持图像、视频、长文档、文本输入的模型,视觉理解与文本推理在同一系统内处理

 专业领域覆盖:官方称覆盖法律、金融、设计等数百个垂直领域,可用于合同审查、财务分析、产品设计等场景

 工具调用内置:原生支持 code_interpreter、web_search、web_extractor、t2i_search(文生图)等工具,可直接调用执行

 

 

第三方榜单:仅次于 Claude

官方的口径是「综合能力仅次于 Fable 5(Claude)」。来自第三方独立评测的数据:

 多个第三方盲测在总分上把 Qwen3.8-Max 排在全球第二,仅次于 Claude Fable 5

 上一代 Qwen3.7-Max 的公开 SWE-bench Pro 成绩是 60.6%,Qwen3.8 正式版的跑分结果预计很快发布

 第三方实测(非官方基准)里,Qwen3.8-Max-Preview 在编程和前端任务上的输出质量,被部分评测者描述为优于 Kimi K3 实测体验——尽管 Kimi K3 的官方 SWE-bench 数字更高

值得注意的局限:截至发布日,官方尚未公布标准化 Benchmark 成绩(SWE-bench Verified / Pro、LiveCodeBench 等)。第三方的「仅次于 Fable 5」判断基于盲测主观评分,不等同于经审计的客观基准。

Claude Fable 5 的 SWE-bench Verified 成绩是 95%,如果 Qwen3.8 正式版达到 70% 以上,才算坐实第二梯队的定位。官方成绩公布前,实测验证比参考榜单口径更有意义。

 

开源计划与时间线

事件

时间

Qwen3.8-Max-Preview 上线

2026 年 7 月 19 日

Qwen3.8-Max 正式版发布

2026 年 8 月 3 日(今日)

Qwen3.8-Max 权重开源

下周(预计 2026 年 8 月 10 日前后)

Qwen3.8-27B 同步开源

同上

这是千问历史上首次把 Max 级别(2T+ 参数规模)的权重开放出来。此前千问系列的开源版本最大到几百亿参数级别(如 Qwen3.6-35B),万亿级一直只在闭源 API 里提供。

同步开源的 Qwen3.8-27B 是稠密模型版本,27B 参数量适合有 2×A100 或 4×A6000 级别算力的团队本地部署——不依赖 API,数据完全自控。

 

API 定价(2026 年 8 月)

QwenCloud 国际站定价:

计费类型

价格

输入

2 美元 / 百万 token

输出

6 美元 / 百万 token

输入(隐式缓存命中)

0.25 美元 / 百万 token

显式缓存读取

0.17 美元 / 百万 token

缓存命中时,输入成本从 2 美元降到 0.25 美元,节省 87.5%。对于 RAG、长文档分析这类多次查询同一上下文的场景,缓存命中率高,实际成本远低于标价。

国内阿里云百炼平台提供单独定价,且有活动折扣(Token Plan 套餐)。

 

和主流模型怎么选

模型

总参数

输出定价(每百万 token)

开源

上下文

Qwen3.8-Max

2.4T(激活 95B)

6 美元

下周开源

1M

Claude Fable 5

闭源未公开

闭源,按订阅

200K

DeepSeek V4-Pro

未公开

2 元/百万(约 0.28 美元)

部分开源

131K

Kimi K3

未公开

约 1-3 元/百万

128K

选 Qwen3.8-Max 的场景:

 需要 100 万 token 超长上下文(分析整本代码库、长法律文件、长视频字幕)

 需要全模态输入(图文视频混合任务)

 看重即将开源的权重(下周可本地部署大参数量模型)

 专业垂直领域任务(法律、金融、设计),需要大参数量支撑的知识覆盖

选 DeepSeek V4-Flash 的场景:

 高频 Agent 调用,成本优先(2 元/百万 token 输出,约 Qwen3.8-Max 的 1/20)

 Codex 工作流接入,优先 Responses API 原生支持

 

对开发者来说,现在该做什么

立即可用:Qwen3.8-Max API 已正式上线,通过阿里云百炼或 QwenCloud 可以直接调用。若你用的是多模型统一接入方案,调用时改 model 字段为 qwen3.8-max 即可切换,无需改动其他配置。

等开源权重:如果你的需求是本地部署——特别是对数据隐私有要求,或者想在私有算力上跑 2.4T 量级的模型——等下周的开源权重更有意义。Qwen3.8-27B 的稠密版本是落地性价比更高的选择。

多模型对比测试:Qwen3.8-Max 正式版上线后,官方跑分还没出来,实测是最可靠的验证手段。如果你的 Agent 工作流或专业领域任务在 Qwen3.7-Max 上已经有基准,拿同样的任务集跑一遍对比是最直接的判断依据。

通过七牛云 AI Token Plan 可以在同一套 API Key 下调用包括 Qwen3.8 在内的多款主流国内大模型,切换模型只改 model 字段,不需要维护多套鉴权配置,适合需要在多模型间做横向测试的团队(qiniu.com/ai/plan)。

 

常见问题

Q:Qwen3.8-Max 和 Qwen3.8-Max-Preview 有什么区别?

Preview 是预览版,以「天」为单位快速迭代,功能完整但稳定性和部分任务质量偏低。正式版是在预览版基础上完成系统性后训练和评估后的稳定版本,官方称编程和前端能力提升明显。API 模型 ID 由 qwen3.8-max-preview 切换为 qwen3.8-max。

Q:2.4T 参数为什么可以只激活 95B?

MoE(混合专家)架构的特性。整个模型被切分为大量「专家」子网络,每次推理时由路由层动态选择少量专家激活参与计算,不激活的专家参数存在内存里但不参与运算。结果是推理计算量等同于 95B 稠密模型,但参数量里的知识容量远超 95B。

Q:下周开源后本地部署需要多少算力?

Qwen3.8-Max(2.4T 参数,FP16/BF16 约需 4.8TB 显存)目前超出消费级硬件范围,需要大规模 GPU 集群。但同步开源的 Qwen3.8-27B 稠密版本要求合理得多——27B 参数 FP16 约需 54GB 显存,2 张 A100 80G 或 4 张 RTX 4090 可以跑起来。

Q:上下文 100 万 token 实际能用来做什么?

100 万 token 约等于 75 万英文单词或 50 万汉字,可以容纳:整本中篇小说全文、中等规模代码库的所有文件、数小时的视频字幕、数百页的法律或金融文件。对于需要「把整个项目放进上下文」做分析的 Agent 任务,100 万上下文是关键能力门槛。

Q:千问办公和 WorkBuddy 是竞品吗?

定位相近——都是面向非开发者的 AI 办公智能体。千问办公由阿里巴巴官方出品,深度绑定 Qwen3.8-Max;WorkBuddy 由腾讯云出品,支持自定义接入多款模型。前者的优势在于模型原生性,后者的优势在于更开放的模型选择和 IM 集成能力。

 

小结

Qwen3.8-Max 正式版今天(2026 年 8 月 3 日)上线,两件事值得记住:一是「下周开源」——千问历史上首次把 Max 级权重放出来,届时 Qwen3.8-27B 也同步可以本地部署;二是「16 天自主编程」的 Hermes Agent 案例,说明长程 Agent 执行能力已经超出演示范畴,进入真实工程可用的边界。SWE-bench 等标准跑分在官方正式公布前仍有待观察,实测验证比参考榜单口径更可靠。

数据来源:阿里云 Qwen 官方公告(2026 年 8 月 3 日)、QwenCloud 模型页面(qwencloud.com/models/qwen3.8-max)、InfoQ / 快科技 / OSCHINA 发布报道(2026 年 8 月 3 日)、第三方评测汇总(2026 年 7-8 月)。

 

延伸阅读

 Qwen3.8-Max API 文档与定价:qwencloud.com/models/qwen3.8-max

 七牛云 AI Token Plan(多模型统一 API Key):https://www.qiniu.com/ai/plan