8月23日,DeepSeek在API平台上线实验版多模态模型V4-Flash-Vision-Exp,首次为其V4-Flash系列增加图像理解能力。该模型能够读取图像并在多个多模态Agent基准测试中表现接近Claude Opus 4.8,每张图片最多计384个token不加价,同时配套免费的Files API。

一、视觉能力首次落地V4-Flash系列
V4-Flash-Vision-Exp的发布标志着DeepSeek正式进军多模态大模型领域。此前,V4-Flash系列仅支持文本处理,而此次更新后,开发者可以通过该模型处理截图、图表、照片等多种图像格式。模型支持JPEG、PNG、GIF和WebP四种主流图像格式,开发者可以通过三种方式传递图像:内联base64数据URL、外部图像URL或通过Files API上传的文件引用。每张图片按最多384个token计费,与文本token使用相同的价格体系,无额外视觉处理费用。
在技术实现上,该模型继承了V4-Flash的文本推理能力,同时增加了统一的视觉编码器,能够将图像转换为模型可理解的token序列。这种设计使得模型能够在同一语义空间中处理文本和图像信息,实现多模态融合理解。
二、多模态Agent基准测试表现亮眼
DeepSeek公布的基准测试结果显示,V4-Flash-Vision-Exp在多个多模态Agent测试中表现优异。特别是在Agents' Last Exam和ZeroBench Pass@5测试中,该模型超越了Anthropic的Claude Opus 4.8。这表明DeepSeek在多模态智能体领域已具备与顶尖模型竞争的实力。
模型在Agents' Last Exam测试中的优势尤为明显,这是一项评估智能体在复杂环境中执行多步骤任务能力的基准。V4-Flash-Vision-Exp能够准确理解任务指令、分析环境状态并做出正确决策,展现出强大的多模态推理能力。
三、开发者生态同步升级
为了方便开发者快速上手,DeepSeek已将V4-Flash-Vision-Exp集成到DeepSeek Harness 0.1.1版本中。Harness是DeepSeek推出的Agent框架,采用“一切皆插件”的设计理念,将智能体拆分为可组合的模块。开发者可以通过Harness框架快速构建具备视觉能力的AI智能体,无需从零开始编写图像处理代码。
此外,DeepSeek还推出了配套的Files API,开发者可以预先上传大文件并获得文件ID,在后续请求中通过ID引用文件,避免每次请求都传输完整数据。这一设计特别适合需要反复分析同一张图片的场景,如质量检测、文档审核等。


