DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛
点击查看原文>
刚刚,DeepSeek 在 API 平台上线实验模型deepseek-v4-flash-vision-exp,开始提供图像理解服务。
根据 DeepSeek 官方文档,用户可以通过设置 来访问 V4-Flash-Vision-Exp 模型的 API。在 API 服务中,图片会转换成 token 后按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。
多模态 API 支持 Chat Completions、Messages、Responses 三种格式调用,可以方便接入各类 Agent 工具中使用,支持图文混合输入,支持 base64 内联、外部 URL、Files API 三种图片传入方式。
这是 DeepSeek V4 系列首次通过官方 API 明确开放视觉输入,也补上了其在多模态开发场景中的一块能力拼图。
在此之前,DeepSeek V4 系列主要以文本推理、代码生成和 Agent 能力见长。
4 月发布的 V4-Flash 采用混合专家架构,总参数量 2840 亿、每个 Token 激活约 130 亿参数,并将 100 万 Token 上下文作为默认配置。
7 月底上线的 V4-Flash-0731 又通过新一轮后训练,重点强化工具调用和长周期 Agent 任务。
但相比之下,Vision-Exp 模型多数指标高于 V4-Flash-0731。

在七项测试中的六项发生变化,其中五项提升、一项小幅下降:
Terminal Bench 2.1:82.7→83.9
NL2Repo:54.2→57.7
DeepSWE:54.4→59.3
Toolathlon-Verified:70.3→75.9
DSBench-Hard:59.6→63.6
AutomationBench:25.1→25.7
Cybergym:76.7→75.3,下降 1.4 分
提升最明显的是 Toolathlon,新模型增加 5.6 分;其次是 DeepSWE,增加 4.9 分。
这两项都与工具调用、真实代码库修改和长周期 Agent 执行有关。
这意味着,Vision-Exp 可能并非简单地在 V4-Flash 外面接入一个视觉编码器,而是在后训练或多模态 Agent 训练中,同时改善了模型理解环境、规划任务和调用工具的能力。
与 Opus 4.8 相比,Vision-Exp 在大多数文本 Agent 测试中仍然稍弱。例如 NL2Repo 低 12 分,DSBench-Hard 低 8.1 分。
但它在 DeepSWE 上达到 59.3,超过 Opus 4.8 的 58.0;Toolathlon 上为 75.9,也只比 Opus 低 0.3 分。
所以更准确的结论是:Vision-Exp 的文本 Agent 能力整体接近 Opus 4.8,在个别代码 Agent 测试上实现反超,但尚未全面超过。
这款模型在正式上线前已经短暂留下过痕迹。
8 月 20 日,有开发者在 DeepSeek Harness 源码中发现deepseek-v4-flash-vision-exp名称,以及与图片附件、本地文件和代码模式相关的配置。
但当时官方 API 端点尚未开放,调用图片请求会返回错误。
不过,V4-Flash-Vision-Exp 目前仍带有“Exp”后缀,官方也明确将其定义为实验性模型。
本文来源:InfoQ