DeepSeek 在多模态领域迈出重要一步,正式推出实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并同步开放 API 接口。用户只需在调用时指定模型名称,即可在原有 V4-Flash 文本处理能力的基础上,新增图片理解功能。这一更新标志着 DeepSeek 的 Agent 技术体系首次完整整合视觉能力,填补了此前在多模态任务处理上的空白。
根据官方披露的测试数据,新模型在文本处理、逻辑推理等传统能力上与正式版 V4-Flash 保持同等水平,但在涉及视觉理解的 Agent 任务中表现显著提升。在专业图表解析任务 Chartography 中,模型得分达到 64.3(置信度 95%);在软件工程长任务测试 DeepSWE 中,成绩从 54.4 提升至 59.3。特别值得注意的是,旧版模型在包含多模态信息的测试集(如 ApexBench)中会直接忽略图片内容,而新模型在这些场景下展现出实质性突破。
技术实现层面,此次更新与 DeepSeek Harness 框架的升级形成联动。在最新发布的 Harness v0.1.0-rc.8 版本中,系统已支持原生图片请求配置,/goal、/plan 等核心指令可同时处理文本和图像输入。开发团队特别优化了大尺寸图片传输和历史图片缓存机制,有效解决了此前因图片处理导致的请求失败问题。现在随着 V4-Flash-Vision-Exp 的上线,Harness 框架终于具备调用原生多模态模型的能力。
官方展示的典型应用案例凸显了视觉能力对 Agent 工作流的变革性影响。在自动生成西藏自驾游 PPT 的任务中,模型需要同时理解旅游路线图、景点照片等视觉元素,并结合文本描述调整版式设计;在重新设计 Harness 官网的案例中,系统需解析现有网页截图,识别导航栏、按钮等 UI 组件位置,再生成修改建议;另一个前端开发案例则要求模型根据 3D 黏土怪物设计图,自动编写包含动画效果的 HTML/CSS 代码。这些场景均需要模型在长链条任务中持续处理视觉反馈,形成完整的执行闭环。
API 设计充分考量了实际使用场景。新模型支持三种数据格式输入,图片可通过 base64 编码、外部 URL 或 Files API 传输。计费系统将图片转换为 token 计算,单张图片最高占用 384 tokens,价格与纯文本模型持平。新增的 Files API 允许用户上传图片后获取唯一 file_id,后续请求可直接调用该 ID 避免重复传输,目前支持 JPEG、PNG、GIF 和 WebP 四种格式。
此次更新并非 DeepSeek 在多模态领域的首次尝试。2024 年该团队曾发布视觉语言模型 DeepSeek-VL,随后推出统一多模态框架 Janus。不同之处在于,V4-Flash-Vision-Exp 是首个直接集成到主力模型体系、官方 API 和 Agent 工作流中的视觉方案。尽管当前版本仍标注为实验性质,且未公布开源权重或完整技术文档,但其与 Harness 框架的深度整合已展现出清晰的技术路线——通过 V4 系列模型提供基础能力,借助 Harness 框架连接真实任务场景,最终通过视觉能力拓展 Agent 的应用边界。












