快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 昨天 · 星期一 · 08-31 19:35 约 2 分钟读完

DeepSeek-V4-Flash-Vision-Exp开源,多模态Agent能力比肩Opus-4.8

摘要

DeepSeek于8月31日开源首个多模态模型V4-Flash-Vision-Exp,采用MIT许可,支持图片输入,在Agent基准测试中较V4-Flash大幅提升,接近Opus-4.8水平,同时保留纯文本任务优势。

DeepSeek今日在Hugging Face平台正式发布并开源了其V4系列的首个多模态模型——DeepSeek-V4-Flash-Vision-Exp。该模型采用MIT License许可,公开了包括模型文件、Tokenizer、Prompt Encoding参考实现及最小化PyTorch推理实现等完整资源,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。

作为V4系列中首款原生支持图片输入的实验版本,V4-Flash-Vision-Exp于2026年8月21日已上线DeepSeek API平台。该模型在文本交互基础上,新增了图片理解能力,可执行图片描述、截图文字识别、图表分析等任务,支持JPEG、PNG、GIF及WebP格式的图片输入。官方明确标注其为实验性版本,旨在探索多模态能力的边界。

深度求索官方表示,V4-Flash-Vision-Exp在各类Agent框架中展现出优异的多模态适配能力,能够有效支持用户借助多样化工具解锁更多实用工作场景。在需要视觉理解的Agent基准测试中,该模型相较V4-Flash正式版有大幅提升,其多模态Agent综合能力已接近Opus-4.8的水平。

值得注意的是,尽管新增了视觉处理能力,该模型在Agent、推理、世界知识等纯文本任务上的表现与V4-Flash正式版持平,原有优势得以完整保留。这一特性使得模型在多模态与纯文本场景间保持了平衡,为开发者提供了更灵活的部署选择。

此次开源延续了DeepSeek一贯的开放策略,MIT许可允许商业使用与自由修改,预计将吸引更多开发者基于该模型构建多模态Agent应用。随着实验版本的迭代,V4系列在多模态方向上的后续进展值得行业关注。

DeepSeek多模态模型开源Agent
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词