搞机工程师
26-08-21 18:54 微博认证:科技博主

这次DeepSeek上视觉模型,我反而没那么关注“它识图有多准”。
我更想看的是:它看完之后,能不能真的帮我把事情做完。
因为现在AI已经不是单纯的聊天机器人了。给它一张网页截图、一份表格、一个产品界面,如果它只能告诉你“这是什么”,其实意义有限;但如果它能看懂画面、判断下一步该做什么,再调用工具把任务继续执行,这才是Agent真正需要的能力。

目前官方披露的信息里,V4-Flash-Vision-Exp在视觉理解相关Agent测试上相比V4-Flash有明显提升,多模态Agent能力已经逼近Opus-4.8。
所以我觉得这次不是简单的“DeepSeek也做视觉模型了”,而是它开始认真补上AI进入真实工作环境最关键的一块拼图。

#DeepSeekV4视觉模型上线#

发布于 上海