DeepSeek 又给 V4 系列补上了一块重要拼图。其官方宣布,实验性质的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。

与此前主要处理文本的 V4-Flash 不同,新模型可以直接接收图片,并将视觉理解能力接入 Agent 工作流。

这也意味着,DeepSeek 的多模态能力开始从模型展示进一步走向 API 服务。

图片

来源:https://api-docs.deepseek.com/updates/

图片

文本能力基本不变,视觉 Agent 能力明显提升

从官方公布的测试结果来看,V4-Flash-Vision-Exp 并不是简单地在文本模型之外“加上看图能力”。

在 Agent、推理、世界知识等纯文本任务上,V4-Flash-Vision-Exp 与正式版 V4-Flash 基本持平。而在需要处理视觉信息的 Agent Benchmark 中,新模型相比 V4-Flash 出现了明显提升。

图片

DeepSeek 特别提到,在 ApexBench、Agents’ Last Exam 等测试中,纯文本版 V4-Flash 会忽略其中包含的多模态元素,因此无法充分完成相关任务。

而加入视觉能力之后,V4-Flash-Vision-Exp 在这些场景中的表现大幅跃升,官方称其多模态 Agent 能力已经接近 Opus-4.8。

图片

多模态能力正式进入 API

对于开发者来说,这次更新更重要的部分还是 API。

据官方介绍,开发者可以通过设置 model='deepseek-v4-flash-vision-exp' 调用新模型。API 支持 Chat Completions、Messages 和 Responses 三种调用格式,可以直接接入现有 Agent 框架。

在输入方式上,模型支持图文混合输入,图片可以通过三种方式传入:

  • Base64 内联

  • 外部 URL

  • Files API

图片在 API 服务中会转换成 Token 进行计费,单张图片最多占用 384 Tokens,价格则与 V4-Flash 保持一致。

这意味着开发者不需要为多模态能力单独适配一套完全不同的调用方式,现有的 Agent 工作流也可以比较方便地加入视觉输入。

图片

Files API 同步上线

与多模态 API 一起开放的,还有 DeepSeek 的 Files API。它主要解决的是图片重复上传的问题。

开发者可以先把图片上传到 DeepSeek 平台,之后在请求中直接通过 file_id 引用。这样一来,同一张图片需要被多次调用时,就不必每次都重新上传,也能减少请求过程中的带宽消耗。目前 Files API 不收取费用。

从这次更新来看,DeepSeek 正在把视觉能力与 Agent 工具调用进一步结合起来,而不是仅仅增加一个“图片输入”的模型接口。

当然,V4-Flash-Vision-Exp 目前仍然带有 Exp(Experimental) 标识,意味着它本质上还是实验性质的模型。实际效果、稳定性以及后续是否进入正式版本,仍需要更多开发者使用和测试。

但至少从 API 开放这一点来看,DeepSeek V4 系列已经开始从纯文本 Agent,向能够同时处理文字、图片和工具的多模态 Agent 继续迈进。

来源:V4-Flash-Vision-Exp 上线,开启多模态 API 服务

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐