核心定义:Qwen 团队于 2026 年 8 月 14 日开放的 Qwen3.8-27B,是一款 270 亿参数、原生支持图像与视频理解的稠密视觉语言模型;双 RTX 3090 本地部署通常需要 INT4 量化,而非直接加载 BF16 权重。

关键事实

  • 官方模型卡标注 27B 参数、64 层,原生上下文长度为 262,144 tokens。

  • 魔搭社区 2026 年模型页显示 BF16 文件约 55.6 GB,超过双 RTX 3090 合计 48 GB 显存,且推理还需 KV Cache 与运行时空间。

  • Qwen 官方 2026 年模型卡报告:Terminal Bench 2.1 得分 73.0,SWE-bench Pro 得分 61.7,QwenSWEBench 得分 79.0。

  • 一项 2026 年 8 月 18 日社区实测使用约 21 GB 的 AWQ-INT4 权重,在无 NVLink 的双 RTX 3090 上以 SGLang 0.5.17 运行。

  • 同一社区实测中,DSpark 在代码/JSON 输出达到 170–210 tok/s;该数字不是官方保证,普通文本和长上下文约为 57–61 tok/s。


Qwen3.8-27B 本地部署是把 Qwen 的 270 亿参数稠密多模态模型运行在本地 GPU 上,并通过 SGLang、vLLM 等引擎提供兼容 OpenAI 的接口。双 RTX 3090 共有 48 GB 显存,实际应选择 INT4 量化并为 KV Cache、CUDA Graph 和多模态编码器预留空间。

Qwen3.8-27B 是什么

Qwen3.8-27B 是 Qwen3.8 系列中的 27B 稠密模型,定位于代码、专业工作、研究和长流程 Agent 任务,同时原生支持图像与视频输入。

官方模型卡给出的关键规格如下:

项目

官方规格

对本地部署的影响

参数量

27B

BF16 仅权重理论上约需 54 GB

网络层数

64 层

首次加载和图编译时间较长

原生上下文

262,144 tokens

长上下文会显著扩大 KV Cache 与预填充开销

模型类型

视觉编码器 + 因果语言模型

纯文本部署也要考虑多模态组件占用

许可证

Apache-2.0

可在遵守许可证的前提下集成与再分发

Qwen3.8-27B 默认启用思考模式,并支持 reasoning_effortxhighmediumlow 三档以及 preserve_thinking。这些参数会改变延迟与 token 消耗,但不能替代显存层面的量化和上下文控制。

双 RTX 3090 能否运行 Qwen3.8-27B

双 RTX 3090 可以运行 Qwen3.8-27B 的 INT4 量化版本,但不适合直接加载完整 BF16 权重。

魔搭社区模型页在 2026 年 8 月显示,官方 BF16 仓库由 18 个权重分片组成,存储大小约 55.6 GB。两张 24 GB 显卡合计只有 48 GB 显存,且模型运行还需要 KV Cache、激活、CUDA Graph 和通信缓冲区,因此 BF16 无法靠简单的双卡张量并行完整容纳。

权重方案

估算或实测占用

双 3090 可行性

适用建议

官方 BF16

文件约 55.6 GB

不适合纯 GPU 常驻

多卡服务器或托管推理

INT8

通常超过 27 GB,另需缓存

有条件可行

优先压缩上下文并实测

AWQ-INT4

社区样例约 21 GB

可行

双 3090 的现实起点

GGUF CPU/GPU 混合卸载

取决于量化与卸载比例

可行但速度不稳定

适合交互测试,不宜直接推断吞吐

显存总量不是唯一约束。无 NVLink 时,两张卡主要通过 PCIe 交换张量;WSL2 还增加 CUDA IPC 与 P2P 兼容变量,因此双卡并不等于吞吐翻倍。

部署前应准备什么

稳定启动的前提是先确认 WSL 能看到两张显卡,再匹配推理引擎、PyTorch 和 CUDA 工具链。

  1. 在 Windows 中安装支持 WSL2 的 NVIDIA 驱动,并启用 WSL2。

  2. 在 WSL 的 Ubuntu 环境中确认两张 RTX 3090 都可见。

  3. 准备至少 64 GB 系统内存与足够的 SSD 空间;下载、解压和加载模型都会产生额外占用。

  4. 选择明确标注兼容 Qwen3.8 与 compressed-tensors 的 AWQ-INT4 权重。

  5. 固定可复现的 SGLang、PyTorch 与 CUDA 组合,不要在可用环境里无条件升级。

nvidia-smi --query-gpu=index,name,memory.total --format=csv
python -c "import torch; print(torch.__version__, torch.version.cuda, torch.cuda.device_count())"

预期结果应同时显示两张 24 GB RTX 3090,并让 torch.cuda.device_count() 返回 2。若这里只返回一张卡,继续修改 SGLang 参数没有意义。

如何用 SGLang 在 WSL2 启动

双 RTX 3090 的保守方案是先用 32K 上下文、80% 静态显存比例启动,再逐步增加上下文和并发。

下面的命令基于社区已验证的 SGLang 0.5.17 参数组合,但把极限上下文收缩到 32K。<WSL_USER> 和模型目录是明确占位符,必须替换为本机实际路径。

export NCCL_P2P_DISABLE=1

python -m sglang.launch_server \
  --model-path /home/<WSL_USER>/models/Qwen3.8-27B-AWQ-INT4 \
  --served-model-name Qwen3.8-27B \
  --port 9090 \
  --tp-size 2 \
  --quantization compressed-tensors \
  --mem-fraction-static 0.8 \
  --context-length 32768 \
  --dtype bfloat16 \
  --disable-custom-all-reduce \
  --mm-feature-transport cpu \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder \
  --max-running-requests 1

这些参数分别解决不同问题:

  • NCCL_P2P_DISABLE=1:在没有 NVLink 的社区环境中避开 P2P 通信问题。

  • --disable-custom-all-reduce:避免自定义 all-reduce 假设 GPU 间存在可用 peer access。

  • --mm-feature-transport cpu:在该 WSL2 实测中绕开 CUDA IPC 的 pidfd_getfd 故障。

  • --mem-fraction-static 0.8:为图捕获和运行时临时空间留出余量。

  • --served-model-name:让客户端使用固定短名称,避免传入本地文件路径。

服务启动后,可用 OpenAI 兼容接口做最小测试:

curl http://127.0.0.1:9090/v1/chat/completions \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "Qwen3.8-27B",
    "messages": [{"role": "user", "content": "用 Python 写一个归并排序"}],
    "temperature": 0.7,
    "stream": false
  }'

若接口健康但输出很慢,应分别测量首 token 延迟、预填充速度和解码速度,不能只看一个端到端 tok/s 数字。

如何优化速度与长上下文

Qwen3.8-27B 的优化顺序应是“先稳定、再扩上下文、最后启用推测解码”,否则很难定位瓶颈。

  1. 建立无推测解码基线。 社区双 3090 样例的基础解码约为 63 tok/s,但不同量化、提示长度与采样方式不可直接横向比较。

  2. 逐级增加上下文。 从 32K、64K、128K 逐步测试;官方 262,144 tokens 是模型能力上限,不代表消费级显卡的默认安全值。

  3. 监控两张卡的显存和利用率。 一张卡接近 24 GB、另一张明显偏低,可能意味着权重切分、多模态组件或缓存分配不均衡。

  4. 只对匹配工作负载启用 DSpark。 社区样例在代码/JSON 上达到 170–210 tok/s,但普通文本约 57 tok/s、长上下文约 61 tok/s,并非所有任务都加速。

  5. 谨慎启用 FP8 KV Cache。 --kv-cache-dtype fp8_e4m3 可节省缓存显存,但需要当前引擎和硬件路径支持,并应通过固定测试集验证输出质量。

官方模型卡说明,Qwen3.8-27B 原生支持 262,144 tokens,并可通过 YaRN 扩展到 1,000,000 tokens。静态 YaRN 可能降低短文本表现,因此只有业务确实超过原生上下文时才应启用;双 3090 更应先解决 KV Cache 容量和预填充延迟。

本地部署、云 API 和多卡服务器怎么选

本地双 3090 适合低并发、数据不出机和持续实验;云 API 适合按量使用;数据中心 GPU 更适合稳定高并发和长上下文。

方案

优势

主要限制

典型场景

双 RTX 3090 + INT4

数据本地、固定成本、可调参数

环境脆弱、无 NVLink、并发低

个人 Agent、内部研发

托管模型 API

无需维护 CUDA 与量化

按 token 计费、数据需出网

峰谷明显、快速集成

数据中心多卡

可运行高精度权重与高并发

硬件与运维成本高

生产推理、团队共享

如果只是验证 OpenAI 兼容调用链,可以先使用托管接口,再决定是否采购本地硬件。例如七牛云 AI 提供兼容 OpenAI/Anthropic 的模型调用方式,可作为本地服务上线前的接口对照;是否包含 Qwen3.8-27B,应以调用时的模型列表为准。

常见问题

Q:一张 RTX 3090 能运行 Qwen3.8-27B 吗?
一张 24 GB RTX 3090 有机会加载部分 INT4 版本,但多模态组件、KV Cache 和运行时余量会非常紧张。实际可用上下文与吞吐取决于量化格式和引擎,不能根据 27B 参数量直接断言可用。

Q:双 RTX 3090 必须安装 NVLink 吗?
不必须。2026 年 8 月的社区案例在无 NVLink、PCIe Gen4 环境中成功运行,但需要禁用部分 P2P 与自定义 all-reduce 路径。NVLink 是否有效还取决于主板拓扑、驱动和框架支持。

Q:为什么加载模型后端口一直没有监听?
常见原因包括量化权重格式与引擎不匹配、CUDA 工具链不一致、CUDA Graph 捕获缺少显存,以及启动脚本续行符丢失。先检查完整启动日志和实际生效参数,不要只观察 GPU 利用率。

Q:170–210 tok/s 是普遍速度吗?
不是。该数字来自一套特定 AWQ-INT4、SGLang 0.5.17、CUDA 13.0 与 DSpark 配置,主要出现在代码和 JSON 工作负载。相同测试中的普通文本和长上下文约为 57–61 tok/s。

Q:应该选 SGLang 还是 vLLM?
官方同时支持 SGLang、vLLM 与 TokenSpeed。双 3090 的社区案例最终选择 SGLang,是特定版本兼容结果,不代表 vLLM 普遍更差。应以目标量化仓库的模型卡和当前框架配方为准。

结论与资料来源

双 RTX 3090 部署 Qwen3.8-27B 的关键不是把官方 262K 上下文一次开满,而是选择兼容的 INT4 权重,以 32K 上下文建立稳定基线,再按显存、首 token 延迟和真实任务吞吐逐级调优。Qwen 官方模型卡定义模型规格与标准接口,DEV Community 的双 3090 记录则提供了可复核但不可泛化的社区实测。

本文内容基于 2026 年 8 月 18 日可访问资料;Qwen3.8、SGLang 和量化仓库仍在快速更新,执行前应重新核对最新模型卡与框架配方。

参考资料