DeepSeek-V4-Flash-Vision-Exp开源,多模态Agent能力比肩Opus-4.8
DeepSeek于8月31日开源首个多模态模型V4-Flash-Vision-Exp,采用MIT许可,支持图片输入,在Agent基准测试中较V4-Flash大幅提升,接近Opus-4.8水平,同时保留纯文本任务优势。
DeepSeek今日在Hugging Face平台正式发布并开源了其V4系列的首个多模态模型——DeepSeek-V4-Flash-Vision-Exp。该模型采用MIT License许可,公开了包括模型文件、Tokenizer、Prompt Encoding参考实现及最小化PyTorch推理实现等完整资源,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。
作为V4系列中首款原生支持图片输入的实验版本,V4-Flash-Vision-Exp于2026年8月21日已上线DeepSeek API平台。该模型在文本交互基础上,新增了图片理解能力,可执行图片描述、截图文字识别、图表分析等任务,支持JPEG、PNG、GIF及WebP格式的图片输入。官方明确标注其为实验性版本,旨在探索多模态能力的边界。
深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架中展现出优异的多模态适配能力,能够有效支持用户借助多样化工具解锁更多实用工作场景。在需要视觉理解的Agent基准测试中,该模型相较V4-Flash正式版有大幅提升,其多模态Agent综合能力已接近Opus-4.8的水平。
值得注意的是,尽管新增了视觉处理能力,该模型在Agent、推理、世界知识等纯文本任务上的表现与V4-Flash正式版持平,原有优势得以完整保留。这一特性使得模型在多模态与纯文本场景间保持了平衡,为开发者提供了更灵活的部署选择。
此次开源延续了DeepSeek一贯的开放策略,MIT许可允许商业使用与自由修改,预计将吸引更多开发者基于该模型构建多模态Agent应用。随着实验版本的迭代,V4系列在多模态方向上的后续进展值得行业关注。