子夜梦廊
26-08-31 21:22 微博认证:科技博主 微博原创视频博主

#DeepSeekV4多模态模型正式开源#
DeepSeek 今天干了一件很"DeepSeek"的事

就在刚刚,DeepSeek 在 Hugging Face 上线了 V4 家族第一个多模态模型:DeepSeek-V4-Flash-Vision-Exp。

MIT License,全开源。

模型文件、Tokenizer、Prompt Encoding 参考实现、最小化 PyTorch 推理代码,全部放出来了。连视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 这些核心模块的代码,都一并公开。

不是只丢个权重让你猜怎么用。是把"怎么看图、怎么编码、怎么推理"的整条链路,摊开给你看。

先说说这个模型本身。

它基于 DeepSeek-V4-Flash,在原有架构上加了视觉模块,经过持续训练获得图像理解能力。同时保留了原来的文本、推理和 Agent 能力。

简单说:以前 V4-Flash 脑子很强,但眼睛是盲的。现在,给它装上了眼睛。

而且官方数据说,装眼睛这件事,没有拖累它的脑子。

纯文本 Agent、推理、世界知识能力,基本保持 V4-Flash 水平。Terminal Bench 从 82.7 升到 83.9,DeepSWE 从 54.4 升到 59.3。文本能力没塌,反而微涨。

多模态 Agent 能力呢?

ApexBench 36.5,Agents' Last Exam 27.3,ZeroBench 35.0,Chartography 64.3。

和 Opus-4.8 放一起比:2 胜 2 负,Chartography 只差 0.7 分。

官方说"多模态 Agent 能力接近 Opus-4.8",从 Benchmark 看,不算夸张。

但最狠的不是跑分,是成本。

高峰期百万输入 Token 3 元,空闲期 1.5 元。价格和 V4-Flash 完全一样。

更狠的是图片 Token 控制。每张图片最多只有 384 个 Token。

大图进模型前会被等比例压缩到大约 800×800 总像素。也就是说,2000×2000 和 5000×5000 的图,最终消耗的 Token 可能一样。

单请求最多可以塞 600 张图。

这瞄准的是什么场景?

Screenshot Agent。Computer Use。Browser Agent。Coding Agent。

一条 Agent 轨迹可能要消费几十甚至上百张截图。如果每张图几千 Token,成本直接爆炸。DeepSeek 把图片压到最高 384 Token,等于在给大规模多模态 Agent 铺路。

最值得尝试的三个应用场景:

第一个,截图类 Agent。

让 AI 看屏幕截图、理解界面、操作软件。以前需要外部 OCR 或者专门的视觉模型,现在 V4-Flash-Vision-Exp 自己就能看、能懂、能操作。一张截图 384 Token,成本可控,大规模部署成为可能。

第二个,图表和文档理解。

财报图表、论文插图、扫描件、发票、合同。模型能读图、能识别文字、能分析数据关系。Chartography 64.3 的分数,说明它在图表操作上的能力已经相当扎实。

第三个,视觉驱动的代码 Agent。

看 UI 设计稿直接生成前端代码、看报错截图定位 Bug、看数据可视化结果调整参数。Vision-Exp 在 DeepSWE 上的提升,说明它能把"看到的东西"和"写出来的代码"连起来。

从模型到 Harness,DeepSeek 在布一盘什么棋?

两周前,DeepSeek 开源了 Harness(DSH),官方 Agent 框架。GitHub 首日星标超 8 万,登顶 Hacker News。

Harness 的核心理念是"一切皆插件"。模型负责思考,Harness 负责执行。

现在,Vision-Exp 上线。模型有了眼睛,Harness 有了看世界的窗口。

这不是两个孤立的产品。这是一套组合拳:

模型(V4-Flash-Vision-Exp)+ 框架(Harness)+ 工具链(Tokenizer、Encoding、Inference 参考实现),全部 MIT 开源。

开发者拿到的是一整套"从看图到做事"的基础设施,不是黑盒 API。

对开发者生态意味着什么?

以前做多模态 Agent,要么用闭源 API(贵、不透明、受制于人),要么自己拼多个开源模型(视觉模型 + 文本模型 + 工具调用,链路复杂、效果难调)。

现在,一个模型搞定视觉理解 + 文本推理 + Agent 工具调用,配套框架和代码全部开源。开发门槛大幅降低,创新速度会快很多。

开源和闭源的差距,还有多大?

这个问题,今年被反复讨论。

DeepSeek 的答案是:在 Agent 场景里,差距正在快速缩小。

Vision-Exp 的多模态 Agent 能力已经逼近 Opus-4.8,而价格是闭源模型的几分之一。加上 Harness 框架的开源,开发者可以基于 DeepSeek 的基座,快速搭建自己的多模态 Agent 应用。

但差距也不是完全不存在。

Vision-Exp 目前还是实验版本(Exp),生产稳定性需要后续版本或自建工程补齐。304.6B 的总参数、48 个权重分片,部署门槛不低,不是普通消费级显卡能跑的。

通用视觉能力(比如复杂街景中的小目标识别、精确计数)也还有提升空间。实测中,汽车数量数得不太准,说明幻觉控制仍需优化。

所以更准确的描述是:在特定场景(截图 Agent、图表理解、视觉驱动编码)上,开源模型已经可以和闭源模型掰手腕。在通用视觉能力和工程稳定性上,还有追赶空间。

但追赶的速度,比去年快多了。

DeepSeek 今天这个动作,和年初开源 V3 时的逻辑一脉相承:

不是只给你用,是让你看懂、让你改、让你基于它做自己的事。

从 V3 到 V4-Flash,从 Harness 到 Vision-Exp,DeepSeek 正在构建一条完整的开源 Agent 链路。

模型负责想,Harness 负责做,Vision 负责看。

全部开源。

对于开发者来说,这不是"又多了一个模型可选"。这是"终于有一套完整的开源基础设施,可以用来构建真正的多模态 Agent"。

剩下的,就是看大家怎么用了。#DeepSeek[超话]##ai创造营#

发布于 上海