DeepSeek-V4-Flash-Vision-Exp 正式开放 API:多模态 Agent 能力今日解锁
发布日期:2026-08-21 | 标签:DeepSeek、多模态视觉、Agent、API、Files API
DeepSeek 于 2026 年 8 月 21 日正式开放多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 的 API 调用权限,这是其首个面向开发者公开的视觉理解模型,通过设置 model='deepseek-v4-flash-vision-exp' 即可接入。模型在纯文本基准上与 V4-Flash 正式版保持持平(Terminal Bench 2.1 得分 83.9、DeepSWE 59.3),同时在多模态 Agent 基准 Chartography 上得分 64.3,接近 Claude Opus-4.8 水准,填补了 DeepSeek 在 API 侧视觉能力的长期空白。计费沿用 V4-Flash 标准,单张图片最多折算 384 tokens;同步上线的 Files API 免费提供图片先传后引用功能,适合多轮 Agent 场景下的图片复用,无需每次请求重复上传。本文梳理了模型的核心能力对比、三种 API 调用方式与 Files API 的使用方法,并分析了 PPT 生成、网站重构、前端 Demo 创作三类典型落地场景。

从"纯文字"到"能看图":V4-Flash-Vision-Exp 的核心变化
DeepSeek-V4-Flash-Vision-Exp 是在 V4-Flash 正式版基础上增加多模态视觉能力的实验性版本,两者共享同一套模型结构与参数规模。
纯文本能力:与 V4-Flash 持平
在覆盖代码 Agent、推理、世界知识的多项基准上,V4-Flash-Vision-Exp 与 V4-Flash 正式版表现相当:
这意味着引入多模态能力后,纯文字任务没有明显退化——开发者在接入视觉功能的同时不需要担心代码和推理能力打折扣。
多模态能力:大幅跃升
在需要视觉理解的 Agent 基准 Chartography(p0.95)上,V4-Flash-Vision-Exp 得分 64.3,整体水准已接近 Claude Opus-4.8 的多模态 Agent 表现。相比只能处理纯文字的 V4-Flash,视觉模型能够直接在 Agent 工作流中读取截图、分析 UI 布局、理解图表数据,省去了人工拆解图片内容再输入文字的中间步骤。
注:上述基准中,文本模型 DeepSeek-V4-Flash 在 ApexBench 与 Agents' Last Exam 中会忽略多模态元素;代码 Agent 类任务使用 DeepSeek Harness 极简模式(max 档,temperature=1.0,top-p=0.95)测试。
如何调用:三种接口格式,兼容主流 Agent 框架
V4-Flash-Vision-Exp 支持 Chat Completions、Messages、Responses 三种调用格式,可以无缝接入 LangChain、AutoGen、CrewAI 等主流 Agent 框架。
基础调用示例(OpenAI 兼容格式)
from openai import OpenAI
client = OpenAI(
api_key="<YOUR_DEEPSEEK_API_KEY>",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://example.com/chart.png" # 外部 URL
}
},
{
"type": "text",
"text": "分析这张图表的趋势,并给出结论"
}
]
}
]
)
print(response.choices[0].message.content)三种图片传入方式:
外部 URL:直接传公网可访问的图片链接,适合快速测试
Base64 内联:将图片编码后嵌入请求体,适合本地文件处理
Files API 的 file_id:先上传再引用,适合多次重复使用同一张图
计费说明
图片按 token 计费,单张最多折算 384 tokens,费率与 V4-Flash 文字 token 相同——输入 1 元/百万 token,输出 2 元/百万 token。以最大值估算,单次发送一张图片的图片部分成本约为 0.000384 元,在 Agent 多轮交互场景中几乎可以忽略不计。
Files API:一次上传,多次引用
与视觉模型同步上线的 Files API 免费开放,解决了 Agent 场景中重复上传同一张图的带宽浪费问题。
工作流程:
使用 Files API 将图片上传到 DeepSeek 平台,获取
file_id在后续请求中通过
file_id引用该图片,无需重新上传同一张图片可在不同会话、不同请求中复用
# 第一步:上传图片
with open("dashboard.png", "rb") as f:
file_response = client.files.create(
file=f,
purpose="vision" # [版本待核实:purpose 字段值请参照官方 Files API 文档确认]
)
file_id = file_response.id
# 第二步:后续请求直接引用 file_id
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "image_file",
"image_file": {"file_id": file_id}
},
{"type": "text", "text": "对比上一次的数据,今天的指标有什么变化?"}
]
}
]
)Files API 本身不收费,上传的图片存储在平台侧。在监控看板定期截图分析、长期项目 UI 评审等场景中,File 引用模式能显著降低单次请求体积。
三个典型 Agent 场景
DeepSeek 发布时给出了三个代表性示例,展示了多模态 Agent 的实际落地空间:
场景一:生成 PPT Agent 接收带有视觉风格要求的提示词后,自主搜索配图、规划布局、生成幻灯片文件。上述西藏自驾游案例中,Agent 处理了"高端定制游"的品牌调性要求,并生成含真实摄影风格配图和三档定价方案的完整 PPT。
场景二:网站二次创作 在给定参考网站截图后,Agent 读取 UI 结构,按"黑蓝深海 + 玻璃 UI + ASCII 原子像素"等视觉要素完成重构,生成可交付的前端代码。这类任务此前需要开发者手动拆解截图描述给文本模型,现在可以直接以图片作为输入。
场景三:前端 Demo 生成 Agent 将视觉概念("3D 黏土小怪物 + 复古舞池")转化为带动态特效的 HTML/CSS/JS Mini Demo,全程无需人工写代码。
这三个场景的共同特征:Agent 需要"看懂"视觉输入才能执行后续步骤——这正是纯文字模型无法完成的环节。
竞争格局:国产多模态 API 补位
2026 年上半年,DeepSeek 在多模态能力上一直是其与 GPT-4o、Gemini 1.5 系列之间的明显差距。今年 4 月,DeepSeek 曾在 App 端灰度"识图模式",但长期未开放 API,让需要集成视觉能力的开发者只能使用第三方服务绕道。
此次 V4-Flash-Vision-Exp 直接开放 API,且接近 Opus-4.8 的多模态 Agent 表现,使 DeepSeek 在"低成本 + 多模态 + Agent 友好"这一组合上具备了与头部产品竞争的筹码。V4-Flash 的定价(输入 1 元/百万 token)在同级多模态模型中仍属于最低档,这对预算敏感的 Agent 应用开发者来说是显著优势。
国内主流推理服务平台(包括阿里百炼、火山方舟等)已陆续同步了 DeepSeek V4 系列。对需要统一管理多个模型调用、控制成本的团队而言,通过支持标准 OpenAI SDK 格式的平台接入是更灵活的选择——例如七牛云 AI 大模型广场支持多款主流模型的统一 API 接入,无需为每家供应商维护单独的密钥和配置。
常见问题
Q:V4-Flash-Vision-Exp 是正式版还是实验版? 当前以 -exp 后缀标注,属于实验性版本。DeepSeek 通常会在实验版经过一段时间验证后推出正式版,正式版 API 名称会去掉 -exp 后缀。实验版功能可用,但官方不保证 SLA,生产环境使用需评估稳定性。
Q:图片大小有没有限制? 官方文档明确单张图片最多折算 384 tokens,但未明确像素上限。建议参照 API 文档中的图像理解指南,测试具体分辨率限制。
Q:Files API 上传的图片会保存多久? DeepSeek 官方目前将 Files API 定位为"免费服务,用于节省请求带宽",具体文件保留时长建议查阅官方 API 指南的 Files API 章节(该页面详细说明了保留策略)。
Q:V4-Flash-Vision-Exp 是否支持视频输入? 当前版本仅支持图片输入(base64、URL、file_id 三种方式),视频输入功能未见官方说明。
Q:如何在 Agent 框架中接入多模态能力? 由于 V4-Flash-Vision-Exp 兼容 OpenAI Chat Completions 格式,在 LangChain、AutoGen、LlamaIndex 等框架中,将模型名替换为 deepseek-v4-flash-vision-exp、base_url 指向 DeepSeek API 端点即可,消息格式无需修改。
小结
DeepSeek-V4-Flash-Vision-Exp 的上线填补了 DeepSeek 系列在 API 侧多模态能力的空白。对开发者来说,关键点有三:一是纯文字任务不退化,现有 Agent 流程迁移无感;二是多模态 Agent 能力已达到可用门槛(接近 Opus-4.8 水准);三是计费与 V4-Flash 一致,成本估算不需要重新建模。Files API 的免费开放则给多轮 Agent 场景提供了图片复用的基础设施。
DeepSeek 自身表示这是实验性版本,后续会有正式版本推出。对团队来说,现在接入实验版做场景验证,是为正式版迁移最低成本的准备路径。
本文信息基于 2026 年 8 月 21 日 DeepSeek 官方公告,建议关注 DeepSeek API 文档以获取最新版本信息。
延伸阅读
DeepSeek API 图像理解指南:https://api-docs.deepseek.com/zh-cn/guides/vision
DeepSeek Files API 文档:https://api-docs.deepseek.com/zh-cn/guides/files_api
多模型 API 按量接入与成本控制:https://www.qiniu.com/ai/plan