DeepSeek-V4-Flash-Vision-Exp 开源:首个 V4 多模态 Agent 模型,部分指标超越 Opus-4.8
发布日期:2026-09-01 | 话题标签:DeepSeek、多模态模型、开源大模型、视觉 Agent
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 于 2026 年 8 月 31 日以 MIT License 在 Hugging Face 完整开源的 V4 系列首个实验性多模态视觉模型,基于 305B 参数 MoE 架构,在成熟的 V4-Flash 纯文本 Agent 底座上通过持续训练加入视觉理解能力。该模型在 Agents' Last Exam(27.3 分)和 ZeroBench Pass@5(35.0 分)两项多模态 Agent 基准上已超越 Claude Opus-4.8,在图表理解(Chartography)和代码 Agent(DeepSWE、Toolathlon-Verified)等维度也与闭源顶级模型差距收窄至个位数,同时保持与 V4-Flash-0731 同等的纯文本 Agent 水准。开源内容涵盖完整权重、Tokenizer 及最小化 PyTorch 推理实现,支持 vLLM、SGLang、Transformers 和 Docker Model Runner,也可通过兼容 OpenAI 格式的官方 API 直接调用。本文完整梳理发布时间线、技术架构、Benchmark 数据对比、本地部署与 API 调用方案,以及适合和不适合引入该模型的具体场景。
什么是 DeepSeek-V4-Flash-Vision-Exp
DeepSeek-V4-Flash-Vision-Exp(以下简称 Vision-Exp)是 DeepSeek V4 系列的第一个多模态版本,定位"实验性质",后缀 -Exp 说明这是一个持续迭代中的研究模型,而非商业稳定版。
两个发布节点:
2026 年 8 月 21 日:上线 DeepSeek API 平台,用户可通过
model='deepseek-v4-flash-vision-exp'调用,正式开启多模态 API 服务2026 年 8 月 31 日:在 Hugging Face 以 MIT License 完整开源,包含模型权重、Tokenizer、Prompt Encoding 参考实现,以及覆盖视觉编码器、Aligner、DFlash Attention、MoE 的最小化 PyTorch 推理实现
两个节点之间间隔 10 天——DeepSeek 先通过 API 验证真实用户反馈,再决定开源,这一节奏与 V3、V4-Flash 系列的一贯策略一致。
参数规模与架构:
总参数:305B(与 V4-Flash-0731 的 304B 基本持平,新增部分来自视觉模块)
架构:MoE(Mixture of Experts)+ 视觉编码器 + Aligner(对齐器)+ DFlash Attention + Hyper-Connections + DSpark 前向路径
任务类型:图像-文本到文本(Image-Text-to-Text)
设计上,Vision-Exp 并非从头训练的多模态模型,而是在已有的高性能纯文本 Flash 模型基础上"续训"出视觉能力——这与 Qwen-VL、InternVL 等系列的思路类似,好处是可以最大限度保留原有文本 Agent 能力,代价是视觉表征可能不如专门设计的多模态架构深度融合。
Benchmark:哪些指标真正领先,哪些仍有差距
官方发布了两组基准数据,分别覆盖文本 Agent 能力和多模态 Agent 能力。
文本 Agent 能力对比
结论:Vision-Exp 的文本 Agent 能力相比 V4-Flash-0731 有全面提升(加入视觉模块并未拖累纯文本),DeepSWE 和 Toolathlon-Verified 两项甚至小幅超过 Opus-4.8,但 NL2Repo 和 DSBench-Hard 仍有约 12 分差距。
多模态 Agent 能力对比
† V4-Flash-0731 在这两项测试中忽略了输入中的多模态元素,因此分数偏低,属于基线参考而非真实竞争
结论:Vision-Exp 在 Agents' Last Exam 和 ZeroBench 两项上已超越 Opus-4.8,在 Chartography(图表理解)上仅差 0.7 分,差距最大的 ApexBench 也收窄至约 3 分。对于需要同时处理图文信息的 Agent 任务,Vision-Exp 已具备与闭源顶级模型正面竞争的实力。
开源内容与本地部署
开源了什么
MIT License 开源意味着可以商用、可以私有化部署、可以微调。具体开放内容:
完整模型权重(BF16、FP8、INT8 等多精度格式)
Tokenizer 和 Prompt Encoding 参考实现
最小化 PyTorch 推理实现(覆盖视觉编码器、Aligner、DFlash Attention、MoE 全链路)
支持的推理框架
本地部署最低要求:305B 参数 BF16 精度需要约 610GB 显存。实际上绝大多数个人开发者会选择:
FP8 精度:约 305GB(4×A100-80G 或 2×H100)
INT4/INT8 量化(社区版):约 160-200GB,精度有损但可接受用于实验
vLLM 快速启动示例
# 安装 vLLM
pip install vllm
# 启动服务(BF16,单机多卡;若使用 HF 上的 FP8 量化权重,vLLM 会自动识别)
vllm serve deepseek-ai/DeepSeek-V4-Flash-Vision-Exp \
--dtype bfloat16 \
--tensor-parallel-size 4 \
--max-model-len 8192API 调用:如何接入 Vision-Exp
如果不想自行部署,DeepSeek 官方 API 已支持该模型,调用接口与 OpenAI 完全兼容。
Python 调用示例
from openai import OpenAI
import base64
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
# 读取本地图片并转 base64
with open("chart.png", "rb") as f:
image_data = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{image_data}"
}
},
{
"type": "text",
"text": "分析这张图表中的数据趋势,并给出结论"
}
]
}
]
)
print(response.choices[0].message.content)两种图片输入格式(均支持,最终得到相同 token ID):
OpenAI 风格 JSON:
image_url+ base64 或公网图片 URL紧凑 TXT 格式:
<image>path/to/image.jpg</image>内联写法,适合批量脚本
国内开发者也可以通过支持多模型统一接入的平台(如七牛云 AI 大模型广场,qiniu.com/ai/models)使用 OpenAI 兼容接口调用多款主流模型,无需为每个服务单独管理 API Key。
适合哪些使用场景
最适合的场景(多模态 Agent 能力经过验证):
1. 图文混合的 Agent 任务 需要同时理解截图、图表、文档图片并做推理决策的场景,例如:读取网页截图后填写表单、根据数据图表生成报告、分析 UI 界面后写自动化脚本。Agents' Last Exam 指标超过 Opus-4.8,说明其在"看图做复杂任务"这类场景已具备顶级水准。
2. 代码与图形的交叉分析 DeepSWE(59.3)超过 Opus-4.8(58.0),Toolathlon-Verified(75.9)接近 Opus-4.8(76.2),说明在编程 Agent 场景下加入图片输入(如截图报错、架构图)并不会显著降低代码理解能力。
3. 图表与数据可视化理解 Chartography 得分 64.3,仅低于 Opus-4.8(65.0)0.7 分,可用于读取 BI 截图、财报图表、传感器数据图等场景。
暂时不适合的场景:
需要极高准确率的代码仓库级理解:NL2Repo(57.7)比 Opus-4.8(69.7)低约 12 分,大型代码库理解仍有明显差距
纯文本长文推理:DSBench-Hard(63.6 vs 71.7)差距仍在
DeepSeek V4 系列梳理
至此,DeepSeek V4 系列已有三个主要版本:
V4-Flash-Vision-Exp 并非 V4-Pro 的多模态版本,而是在成本更低的 Flash 分支上率先引入视觉能力——这意味着 DeepSeek 选择了"先把多模态能力跑通,再往重模型推进"的路线,未来不排除会推出正式的 V4-Vision 或 V4-Pro-Vision。
FAQ
Q:Vision-Exp 开源了完整权重吗,还是只有推理代码? A:完整开源,包含 BF16、FP8、INT8 等格式的模型权重,以及 Tokenizer 和最小化 PyTorch 推理实现,MIT License 可商用。
Q:没有多卡服务器,能用量化版在普通机器上跑吗? A:HuggingFace 已有 6 个社区量化版本(llama.cpp / Ollama / LM Studio 格式),INT4 量化约需 160GB 显存,可在 2×A100 配置上运行,但精度会有一定损失。
Q:Vision-Exp 是否支持视频输入? A:目前官方文档仅明确支持图像-文本到文本任务,视频输入尚未提及,建议以图帧抽取方式处理视频场景。
Q:API 定价与 V4-Flash-0731 相比是否更贵? A:DeepSeek 官方未单独公布 Vision-Exp 的定价,实验性模型通常与对应 Flash 版本定价相近,具体以 DeepSeek 官网价格页(api-docs.deepseek.com)为准。
Q:Vision-Exp 的"Exp"标签意味着什么? A:Experimental(实验性)标签表示该模型仍在持续更新中,接口和权重可能随时变动,不建议直接用于稳定生产环境,适合评估与研究用途。
总结
DeepSeek-V4-Flash-Vision-Exp 的开源,标志着 DeepSeek V4 系列正式进入多模态阶段。305B MoE 架构、MIT 开源协议、以及在 Agents' Last Exam 和 ZeroBench 上超越 Opus-4.8 的实测表现,让它成为目前开源多模态 Agent 模型中最值得评测的选项之一。该模型于 2026 年 8 月 31 日上线 HuggingFace,支持 vLLM / SGLang / Transformers 全家桶,开发者可以直接拉取权重或通过兼容 OpenAI 接口的 API 平台快速集成。
延伸阅读
DeepSeek-V4-Flash-Vision-Exp 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
DeepSeek API 文档(中文):https://api-docs.deepseek.com/zh-cn/
DeepSeek-V4-Flash-0731 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
七牛云 AI 大模型广场(多模型统一接入):https://www.qiniu.com/ai/models