【DeepSeek V4终于补上视觉:多模态Agent能力逼近Opus 4.8】
#DeepSeek# 的 Agent 路线,终于补上了视觉这一块。
就在今天下午,DeepSeek 正式上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并同步开放 API。用户只需将模型名称设置为 deepseek-v4-flash-vision-exp,即可在原有 V4-Flash 的基础上加入图片理解能力。
按照 DeepSeek 公布的数据,新模型在纯文本 #Agent# 、推理和世界知识等能力上与正式版 V4-Flash 基本持平,而在需要视觉理解的 Agent Benchmark 上出现明显提升。DeepSeek 称,其多模态 Agent 能力已经接近 Claude Opus 4.8。
这次更新其实延续了 DeepSeek 最近一个相当清晰的方向:把模型能力进一步推向 Agent。
在今年 4 月 V4 发布后,DeepSeek 一直在强化工具调用和 Agent 能力。7 月底更新的 V4-Flash 已专门针对 Agent 做过后训练,8 月 13 日正式版 V4-Pro 又进一步提升了生产环境中的 Agent 表现,并原生支持 Responses API。与此同时,DeepSeek 最近还开放了自家的 Agent 框架 DeepSeek Harness,试图把模型、工具调用、文件操作、搜索、子 Agent 等能力组织进同一套工作流。
戳链接查看详情:http://t.cn/AXptzfVo
