数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

DeepSeek V4新动作:上线视觉理解模型 多模态Agent能力再升级

2026-08-22来源:快讯编辑:瑞雪

DeepSeek 在多模态领域迈出重要一步,正式推出实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并同步开放 API 接口。用户只需在调用时指定模型名称,即可在原有 V4-Flash 文本处理能力的基础上,新增图片理解功能。这一更新标志着 DeepSeek 的 Agent 技术体系首次完整整合视觉能力,填补了此前在多模态任务处理上的空白。

根据官方披露的测试数据,新模型在文本处理、逻辑推理等传统能力上与正式版 V4-Flash 保持同等水平,但在涉及视觉理解的 Agent 任务中表现显著提升。在专业图表解析任务 Chartography 中,模型得分达到 64.3(置信度 95%);在软件工程长任务测试 DeepSWE 中,成绩从 54.4 提升至 59.3。特别值得注意的是,旧版模型在包含多模态信息的测试集(如 ApexBench)中会直接忽略图片内容,而新模型在这些场景下展现出实质性突破。

技术实现层面,此次更新与 DeepSeek Harness 框架的升级形成联动。在最新发布的 Harness v0.1.0-rc.8 版本中,系统已支持原生图片请求配置,/goal、/plan 等核心指令可同时处理文本和图像输入。开发团队特别优化了大尺寸图片传输和历史图片缓存机制,有效解决了此前因图片处理导致的请求失败问题。现在随着 V4-Flash-Vision-Exp 的上线,Harness 框架终于具备调用原生多模态模型的能力。

官方展示的典型应用案例凸显了视觉能力对 Agent 工作流的变革性影响。在自动生成西藏自驾游 PPT 的任务中,模型需要同时理解旅游路线图、景点照片等视觉元素,并结合文本描述调整版式设计;在重新设计 Harness 官网的案例中,系统需解析现有网页截图,识别导航栏、按钮等 UI 组件位置,再生成修改建议;另一个前端开发案例则要求模型根据 3D 黏土怪物设计图,自动编写包含动画效果的 HTML/CSS 代码。这些场景均需要模型在长链条任务中持续处理视觉反馈,形成完整的执行闭环。

API 设计充分考量了实际使用场景。新模型支持三种数据格式输入,图片可通过 base64 编码、外部 URL 或 Files API 传输。计费系统将图片转换为 token 计算,单张图片最高占用 384 tokens,价格与纯文本模型持平。新增的 Files API 允许用户上传图片后获取唯一 file_id,后续请求可直接调用该 ID 避免重复传输,目前支持 JPEG、PNG、GIF 和 WebP 四种格式。

此次更新并非 DeepSeek 在多模态领域的首次尝试。2024 年该团队曾发布视觉语言模型 DeepSeek-VL,随后推出统一多模态框架 Janus。不同之处在于,V4-Flash-Vision-Exp 是首个直接集成到主力模型体系、官方 API 和 Agent 工作流中的视觉方案。尽管当前版本仍标注为实验性质,且未公布开源权重或完整技术文档,但其与 Harness 框架的深度整合已展现出清晰的技术路线——通过 V4 系列模型提供基础能力,借助 Harness 框架连接真实任务场景,最终通过视觉能力拓展 Agent 的应用边界。

AI冲击数学界:美国数学家告别探索答案,投身构建答案验证系统
5月,OpenAI宣布其模型在匈牙利数学家保罗·埃尔德什提出的“平面单位距离问题”中,设计出一种新的点集构造方法,在相同规模约束下得到更多单位距离对,被认为突破了长期以来基于规则几何结构的经验性直觉。其中一…

2026-08-21

华能温枢刚与华为任正非会谈 共探AI发展电力电信网络成关键支撑
【CNMO科技消息】8月21日,据中国华能集团有限公司官方微信消息,中国华能集团有限公司董事长、党组书记温枢刚一行在深圳,与华为公司董事、CEO任正非等相关人员会谈,双方围绕科技创新、AI应用以及能源领域合作…

2026-08-21