马弘运
26-08-21 17:43 微博认证:数码测评师 资深摄影师 青年作家 科技博主

#DeepSeekV4视觉模型上线#

今天 DeepSeek 上线了一个很容易被低估的模型:DeepSeek-V4-Flash-Vision-Exp。

表面看,是 DeepSeek V4-Flash 终于加入了视觉能力。

但我觉得真正重要的不是“DeepSeek 也能看图了”,而是 DeepSeek 正在从一个擅长文字、推理和代码的大模型,正式向真正的多模态 Agent 底座迈过去。

这两者的区别非常大。

过去的大模型更像一个坐在电脑前、但只能听你转述屏幕内容的高手。你可以把代码、文档、日志复制给它,它可以分析得很好;但一旦任务变成“看看这个网页哪里有问题”“根据截图操作软件”“读这个复杂图表然后继续执行”,模型就缺了一双眼睛。

DeepSeek V4 此前其实就存在这个问题。

官方过去的文档明确写过,V4 本身是纯文本模型,像 GitHub Copilot 这类产品如果给 DeepSeek 输入图片,需要先调用其他视觉模型把图片描述成文字,再交给 DeepSeek。(DeepSeek API Docs)

这意味着过去的 DeepSeek Agent,本质上经常是:

别人负责看,DeepSeek 负责想。
而今天 Vision-Exp 上线以后,开始变成:
DeepSeek 自己看、自己理解、自己推理,再自己调用工具完成任务。这才是这次更新真正值得注意的地方。

从 DeepSeek 公布的数据看,Vision-Exp 的纯文本 Agent、推理、世界知识能力基本保持在 V4-Flash 正式版水平,并没有为了加入视觉能力明显牺牲原本的文本能力。

一些 Agent 指标甚至继续提高:
Terminal Bench 2.1 做到 83.9,NL2Repo 57.7,DeepSWE 59.3,DSBench-Hard 63.6,Agents’ Last Exam 27.3。

而真正拉开差距的是需要视觉理解的 Agent 任务。

DeepSeek 给出的评价是:多模态 Agent 能力已经接近 Claude Opus 4.8。需要注意,这句话说的是“需要视觉理解的 Agent benchmark”,并不是说 Vision-Exp 的所有能力已经全面追平 Opus 4.8。(via:Reddit)

我反而觉得,这个限定让这件事更值得关注。
因为现在大模型竞争正在发生一个很明显的变化:
单纯回答问题的重要性正在下降,模型能不能真正完成任务的重要性正在提高。

未来 Agent 要操作浏览器,就必须看得懂网页;
要帮你做 Excel、PPT,就必须理解表格、图表和版式;要操作电脑,就必须识别按钮、菜单、弹窗和界面状态;要做金融、医疗、工业场景,就必须真正读懂专业图表,而不是只会 OCR 几行文字。

例如最近发布的专业图表理解 benchmark Chartography,就是专门拿医学、工程、金融等真实专业图表测试模型,研究发现大量错误并不是模型不会推理,而是第一步就“看错了”。(via:arXiv)

ZeroBench 更直接,它就是专门针对当代多模态模型设计的高难度视觉推理 benchmark,很多错误集中在识别、计数和视觉 grounding,而不是数学推理。(via:ZeroBench)

所以今天大模型要继续往 Agent 走,视觉不是锦上添花,而是基础设施。一个没有视觉能力的 Agent,就像一个智商很高但蒙着眼睛操作电脑的人。

这也是我认为 DeepSeek 今天这个实验模型意义最大的地方。

回头看 DeepSeek V4 最近几个月的路线,其实越来越清晰:

V4 先解决百万上下文、推理和 Agent 基础能力;

V4-Flash 把 Agent 做得更快、更便宜;

V4-Pro 再把复杂任务能力往旗舰模型推;

现在 Vision-Exp 把视觉输入接进 Agent。

下一步真正值得期待的,已经不是“DeepSeek 能不能识别一张猫的照片”。

而是它能不能看着你的电脑屏幕,理解当前状态,自己规划任务,自己操作浏览器和软件,在几十甚至上百步之后把事情真正做完。

如果这条路线继续往前走,DeepSeek 的竞争对象也就不只是 ChatGPT、Claude、Gemini 的聊天框了。

真正的战场会变成谁能成为未来电脑上的 Agent Runtime。模型负责大脑,Vision 负责眼睛,Harness 负责手脚,API 负责把这一切接进开发者的软件和工作流。

到了那个阶段,我们讨论的可能已经不是“哪个模型回答问题更聪明”,而是:你的电脑,到底准备让谁来操作。当然,现在这个模型名字里还有一个很重要的后缀——Exp。

实验模型意味着稳定性、视觉幻觉、复杂 GUI 定位、连续操作一致性以及实际成本,都还需要大量真实场景验证。所以现在就说 DeepSeek 已经全面追平最强多模态模型,还太早。

但我认为方向已经非常明确,DeepSeek 缺的那双“眼睛”,终于开始补上了。

而当一个原本就很擅长推理、代码和 Agent 的模型真正拥有视觉能力之后,可能比“多了一个看图功能”要重要得多。

因为下一代 AI 的终点,本来就不是陪你聊天。

而是替你看、替你想、替你操作,最后替你把事情做完。#deepseek##ai#

发布于 四川