伊妹耳
26-08-21 18:53 微博认证:科技博主

普通用户看到这次更新,可能就是一句:DeepSeek现在也能看图了。但对开发者来说,意义可能大得多。因为这次不是单独做了一个聊天玩具,而是直接把V4-Flash-Vision-Exp放进API里。图片和文本可以一起作为输入,还支持Tool Calls、Responses API等能力。

这意味着以后做AI应用,可以少绕很多路。比如拍张设备照片让Agent判断故障,看一张表格直接提取数据,读懂网页截图再决定下一步操作,甚至让视觉信息直接参与整个Agent流程。

以前是“AI告诉你这张图是什么”,接下来可能变成“AI看懂这张图,然后替你把后面的事情办了”。这才是我觉得这次更新真正有意思的地方。

#DeepSeekV4视觉模型上线#

发布于 上海