古德猛安
26-08-21 18:51 微博认证:数码博主 吐个槽网络运营兼创始人 互联网及游戏行业评论员

DeepSeek这次上视觉模型,我觉得最大的信号不是“又多了一个模型”,而是多模态这条赛道真的开始卷了。

文本模型大家已经卷了很久,现在竞争正在往下一层走:谁能看懂现实世界,谁能把看到的信息真正用起来。
V4-Flash-Vision-Exp目前还是实验性质,但纯文本能力保持V4-Flash正式版水平,同时在视觉理解相关Agent测试上明显提升,官方披露的多模态Agent能力已经接近Opus-4.8。

我反而挺期待后面的正式版。
因为一旦视觉、语言、工具调用真正揉到一起,AI的使用方式可能会变得完全不一样。
以后我们给AI的输入,可能不再是一句话,而是整个屏幕、整个文件夹,甚至整个现实世界。

这才是多模态真正值得期待的地方。

#DeepSeekV4视觉模型上线#

发布于 上海