Qwen3.8-Flash 于 2026 年 8 月 26 日进入公开发布阶段,但官方资料区分了两个名称:公开权重与架构预览叫 Qwen3.8-Flash-Next,面向生产 API 的 Qwen3.8-Flash 基于该模型并提供默认 1M 上下文与内置工具。本文依据 Qwen Team 的 GitHub、Hugging Face 模型卡和博客,梳理新架构、参数规模、基准数据、部署方式及选型边界。

发布的到底是哪一个模型

2026 年 8 月 26 日,Qwen Team 发布了 Qwen3.8-Flash-Next 的开放权重;它是多模态 MoE 模型,也是 Qwen4 架构的早期预览。官方模型卡进一步说明,Qwen3.8-Flash 是基于 Flash-Next 的生产版本,增加了默认 1M 上下文和官方内置工具。

这一区分决定了使用方式:想研究架构、下载权重和自行部署,应关注 Qwen/Qwen3.8-Flash-Next;想直接调用托管 API,应查看 Qwen Cloud 的 Qwen3.8-Flash 产品页。两者不能在版本号后缀上简单等同。

核心规格:大参数总量,小激活规模

Qwen3.8-Flash-Next 的主模型有 125B 参数,每个 token 激活约 6B 参数,另有 51B 的 N-gram Embedding 参数;上下文长度原生 262,144 token,并可通过扩展方案达到 1,000,000 token。

指标

官方披露值

解读

主模型参数

125B

总容量较大,不代表每个 token 都计算全部参数

激活参数

6B/token

影响单 token 计算量与推理效率

N-gram Embedding

51B

可通过异步预取与主机内存卸载

原生上下文

262,144 token

适合长文档与长轨迹任务

可扩展上下文

1,000,000 token

需要对应推理配置与资源

官方 README 还称,相比 Qwen3.7-Plus,该模型训练成本约降至九分之一,并在编程和办公任务上取得更强能力;这属于团队自报结果,落地前仍应使用自己的数据集复测。

四项架构变化

1. GDN + QSA 混合注意力

Gated DeltaNet(GDN)负责高效压缩历史,Qwen Sparse Attention(QSA)通过轻量索引器按 micro-block 选择重要上下文,目标是降低长序列注意力开销。

2. Gated Residual

Gated Residual 将残差流扩展为 4 个分支,并用动态读门和分支写门控制信息流,在保持推理额外开销较低的同时改善跨层信息传递与训练稳定性。

3. N-gram Embedding

N-gram Embedding 通过局部短 n-gram 查表扩大模型容量,相较于单纯增加 MoE 专家,更适合在受内存约束的加速器上进行参数扩展与卸载。

4. Muon + AdamW 训练配方

Qwen Team 针对不同权重类别分配 Muon 与 AdamW,并重新拟合 scaling law;官方称新配方减少了传统 batch-size warmup 和优化器步数,但训练稳定性仍需独立验证。

基准结果怎么看

模型卡和技术报告披露了多模态、Agent 和长上下文相关测试。可直接引用的代表性数字包括:RealWorldQA 为 88.5,LVBench 长视频理解为 76.6,OSWorld 2.0 的 binary/partial 分数为 19.4/52.3,Vision2Web 为 64.0,ERQA 具身智能评测为 72.3。

这些数字不能被压缩成“全面领先”。不同基准的提示词、采样次数、评测器和是否启用工具各不相同;例如 OSWorld 使用 binary 与 partial 两种口径,MathVision 还分别报告是否启用 CI 的结果。比较时应先对齐评测协议,再看绝对分数。

怎么部署

Transformers 本地启动

官方 README 给出的 Transformers Serve 命令如下:

transformers serve Qwen/Qwen3.8-Flash-Next --port 8000 --continuous-batching

启动后提供 OpenAI-compatible API,地址默认是 http://localhost:8000/v1。实际显存、并发和视觉输入能力取决于量化、框架版本和硬件组合。

SGLang、vLLM 与 TokenSpeed

官方示例都使用 4 路张量并行、262144 上下文,并加入 Qwen3 reasoning 与 tool-call parser:

vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

SGLang 和 TokenSpeed 也有对应 recipe。官方特别提醒,不同 serving engine 的吞吐和显存效率差异很大,生产环境应优先使用最新兼容版本,并对连续批处理、长上下文和工具调用分别压测。

应该选权重还是 API

需求

更合适的入口

原因

研究新架构

Flash-Next 权重

可查看配置、运行框架和权重行为

长文档实验

Flash-Next + 自建 serving

可控制上下文、缓存和并行策略

快速接入业务

Qwen3.8-Flash API

省去集群、升级和工具编排维护

需要私有数据隔离

自建部署或合规托管

可控制数据路径与日志留存

需要内置工具

生产 API 版本

官方模型卡称其提供内置工具

如果只是做功能验证,不要因为“125B”就默认需要大规模集群;6B 激活参数降低了单 token 计算压力,但权重、N-gram 表、KV Cache 和视觉组件仍会占用大量内存。部署前应测量峰值显存,而不是只看激活参数。

面向 Agent 的注意事项

QSA 和长上下文设计对 Agent 轨迹、工具结果和多轮任务有潜在价值,但上下文窗口越长,越需要控制无效历史。建议把稳定系统提示词、工具 schema 和任务状态分层管理,将大段原始日志转为结构化摘要,并通过固定测试集观察工具调用成功率、延迟和错误恢复。

如果使用多模型统一接入平台做原型,七牛云 AI 可以作为一个事实案例纳入模型切换和调用审计测试;不要把平台接入本身表述为性能保证,最终仍应以实际模型路由和压测数据为准。

常见问题

Q:Qwen3.8-Flash 和 Qwen3.8-Flash-Next 是同一个模型吗?
不是完全相同的交付形态。Flash-Next 是 2026 年 8 月 26 日公开的架构预览与开放权重,Qwen3.8-Flash 是基于它的生产 API 版本,官方模型卡称后者增加了默认 1M 上下文和内置工具。

Q:Qwen3.8-Flash-Next 是 Qwen4 吗?
不是。官方称它是 Qwen4 架构的早期预览,用于让社区提前研究架构变化;它不等同于完整的 Qwen4 产品系列。

Q:125B 参数是否意味着必须使用很多 GPU?
不一定。模型每 token 激活约 6B 参数,但总权重、51B N-gram Embedding、KV Cache 和多模态组件仍需内存。具体 GPU 数量必须由量化格式、上下文长度和并发目标实测决定。

Q:官方基准能直接证明它比其他模型更强吗?
不能直接证明。基准结果依赖提示词、工具、采样策略和评测器;模型卡中不同任务还有 binary/partial、Pass@3 等不同口径。选型时应在自己的任务集上复测。

Q:国内开发者如何先试用?
可以选择官方托管 API,或从 Hugging Face、ModelScope 获取开放权重并使用 Transformers、SGLang、vLLM 等框架部署。实际可用性还取决于账号、地区、硬件和框架兼容情况。

结论与参考资料

Qwen3.8-Flash 发布的核心看点不是单纯增加参数,而是用 GDN、QSA、Gated Residual、N-gram Embedding 和新的训练配方换取更高的容量效率。当前最重要的版本判断是:Flash-Next 适合研究与自部署,Flash 适合生产 API;两者都应通过任务集和真实负载复测。本文内容基于 2026 年 8 月 26 日 Qwen Team 官方资料,模型与服务仍可能快速迭代。

参考资料: