Qwen3.8-Flash-Next开源首发:SGLang与vLLM实战部署全攻略
发布日期:2026-08-27
Qwen3.8-Flash-Next 是通义千问团队于 2026 年 8 月 26 日开放权重的多模态 MoE 模型,也是 Qwen4 预览版。它由 125B 模型和 51B N-gram Embedding 组成,单 token 激活约 6B,原生上下文 262,144 token。部署重点是匹配 FP8/BF16 权重、GPU 拓扑和 day-0 引擎。
1. 规格与硬件
总参数为 176B(125B + 51B),但每 token 只激活约 6B;N-gram 表可异步放到主机内存。Qwen 报告 QSA 注意力内核最高约 10.2 倍 prefill、6.6 倍 decode 加速。
权重选择:BF16 使用 Qwen/Qwen3.8-Flash-Next,FP8 使用 Qwen/Qwen3.8-Flash-Next-FP8;NVFP4 是面向 B200/B300/GB300 的 Blackwell 社区量化。
vLLM recipe 估算 FP8 约 172.78 GiB、建议至少 265 GB GPU 显存;BF16 约 335.28 GiB、建议至少 423 GB,另需为 KV cache 留余量。
2. SGLang
SGLang 官方 cookbook 将它列为 day-0 模型,稳定 PyPI 版可能尚未包含架构。NVIDIA 先拉专用镜像,再在容器内启动:
docker pull lmsysorg/sglang:qwen38flashnext
sglang serve --model-path Qwen/Qwen3.8-Flash-Next-FP8 \
--port 8000 --tp-size 4 --context-length 262144 \
--reasoning-parser qwen3 --tool-call-parser qwen3_coderAMD MI350X/MI355X 使用 lmsysorg/sglang-rocm:qwen38flashnext,不要与 CUDA 镜像混用。
3. vLLM
vLLM recipe 指定专用镜像 vllm/vllm-openai:qwen38-flash-next。4 张 GB300 的 FP8 + TP4 可用:
vllm serve Qwen/Qwen3.8-Flash-Next-FP8 \
--tensor-parallel-size 4 --gpu-memory-utilization 0.90 \
--max-num-seqs 256 --enable-prefix-caching \
--no-enable-flashinfer-autotune \
--enable-auto-tool-choice --tool-call-parser qwen3_coder \
--reasoning-parser qwen38 张 H200 的 FP8 应使用 TEP8(TP8 + Expert Parallel),不能照搬普通 TP8。低延迟可追加 MTP 参数。加载 OOM 时增加 TP、降低 --max-model-len,或设置 VLLM_PLE_CPU_OFFLOAD=1 将 N-gram 表放入主机内存。
4. 长上下文与验证
原生上下文是 262,144;扩展到 1,000,000 要显式启用 YaRN,并先做质量回归:
VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve Qwen/Qwen3.8-Flash-Next-FP8 \
--tensor-parallel-size 4 \
--rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":262144}' \
--max-model-len 1000000模型始终开启思考;--reasoning-parser qwen3 会把思考拆到 reasoning_content。服务启动后检查 OpenAI 兼容接口:
curl http://localhost:8000/v1/chat/completions -H 'Content-Type: application/json' \
-d '{"model":"Qwen/Qwen3.8-Flash-Next-FP8","messages":[{"role":"user","content":"解释 GDN 和 QSA 的分工"}]}'显存不足可先把上下文降到 32768 或 65536。
5. 本地还是托管
没有多卡服务器时,本地成本主要来自显存、主机内存和镜像维护。生产版 qwen3.8-flash 默认 1M 上下文并带工具,博客列价为每百万输入 token 0.16 美元、输出 token 0.47 美元。低频调用可评估托管,高并发或需自定义参数时本地更可控。
七牛云 AI 大模型广场可用于横向评测。
常见问题
Q:24GB 或 48GB 单卡能运行官方权重吗?
不适合。官方 BF16/FP8 权重需要数百 GB 级总显存;低比特量化需另行确认引擎支持。
Q:SGLang 和 vLLM 怎么选?
SGLang 适合跟随官方 cookbook 验证矩阵;vLLM 适合已有 OpenAI-compatible 服务和 TP/TEP 运维经验的团队。两者都应使用专用版本或镜像。
结论与参考资料
部署关键是同时匹配权重精度、硬件拓扑和专用引擎版本。建议从官方 FP8、单节点 TP/TEP 和原生 262K 开始,再启用 MTP、CPU offload 或 YaRN。本文基于 2026 年 8 月 27 日官方仓库与文档,day-0 镜像和量化仓库会变化。
SGLang Cookbook:https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-Flash-Next
vLLM Recipe:https://recipes.vllm.ai/Qwen/Qwen3.8-Flash-Next
七牛云 AI 大模型广场:https://www.qiniu.com/ai/models