#DeepSeekV4多模态模型正式开源#
DeepSeek 今天干了一件很"DeepSeek"的事
就在刚刚,DeepSeek 在 Hugging Face 上线了 V4 家族第一个多模态模型:DeepSeek-V4-Flash-Vision-Exp。
MIT License,全开源。
模型文件、Tokenizer、Prompt Encoding 参考实现、最小化 PyTorch 推理代码,全部放出来了。连视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 这些核心模块的代码,都一并公开。
不是只丢个权重让你猜怎么用。是把"怎么看图、怎么编码、怎么推理"的整条链路,摊开给你看。
先说说这个模型本身。
它基于 DeepSeek-V4-Flash,在原有架构上加了视觉模块,经过持续训练获得图像理解能力。同时保留了原来的文本、推理和 Agent 能力。
简单说:以前 V4-Flash 脑子很强,但眼睛是盲的。现在,给它装上了眼睛。
而且官方数据说,装眼睛这件事,没有拖累它的脑子。
纯文本 Agent、推理、世界知识能力,基本保持 V4-Flash 水平。Terminal Bench 从 82.7 升到 83.9,DeepSWE 从 54.4 升到 59.3。文本能力没塌,反而微涨。
多模态 Agent 能力呢?
ApexBench 36.5,Agents' Last Exam 27.3,ZeroBench 35.0,Chartography 64.3。
和 Opus-4.8 放一起比:2 胜 2 负,Chartography 只差 0.7 分。
官方说"多模态 Agent 能力接近 Opus-4.8",从 Benchmark 看,不算夸张。
但最狠的不是跑分,是成本。
高峰期百万输入 Token 3 元,空闲期 1.5 元。价格和 V4-Flash 完全一样。
更狠的是图片 Token 控制。每张图片最多只有 384 个 Token。
大图进模型前会被等比例压缩到大约 800×800 总像素。也就是说,2000×2000 和 5000×5000 的图,最终消耗的 Token 可能一样。
单请求最多可以塞 600 张图。
这瞄准的是什么场景?
Screenshot Agent。Computer Use。Browser Agent。Coding Agent。
一条 Agent 轨迹可能要消费几十甚至上百张截图。如果每张图几千 Token,成本直接爆炸。DeepSeek 把图片压到最高 384 Token,等于在给大规模多模态 Agent 铺路。
最值得尝试的三个应用场景:
第一个,截图类 Agent。
让 AI 看屏幕截图、理解界面、操作软件。以前需要外部 OCR 或者专门的视觉模型,现在 V4-Flash-Vision-Exp 自己就能看、能懂、能操作。一张截图 384 Token,成本可控,大规模部署成为可能。
第二个,图表和文档理解。
财报图表、论文插图、扫描件、发票、合同。模型能读图、能识别文字、能分析数据关系。Chartography 64.3 的分数,说明它在图表操作上的能力已经相当扎实。
第三个,视觉驱动的代码 Agent。
看 UI 设计稿直接生成前端代码、看报错截图定位 Bug、看数据可视化结果调整参数。Vision-Exp 在 DeepSWE 上的提升,说明它能把"看到的东西"和"写出来的代码"连起来。
从模型到 Harness,DeepSeek 在布一盘什么棋?
两周前,DeepSeek 开源了 Harness(DSH),官方 Agent 框架。GitHub 首日星标超 8 万,登顶 Hacker News。
Harness 的核心理念是"一切皆插件"。模型负责思考,Harness 负责执行。
现在,Vision-Exp 上线。模型有了眼睛,Harness 有了看世界的窗口。
这不是两个孤立的产品。这是一套组合拳:
模型(V4-Flash-Vision-Exp)+ 框架(Harness)+ 工具链(Tokenizer、Encoding、Inference 参考实现),全部 MIT 开源。
开发者拿到的是一整套"从看图到做事"的基础设施,不是黑盒 API。
对开发者生态意味着什么?
以前做多模态 Agent,要么用闭源 API(贵、不透明、受制于人),要么自己拼多个开源模型(视觉模型 + 文本模型 + 工具调用,链路复杂、效果难调)。
现在,一个模型搞定视觉理解 + 文本推理 + Agent 工具调用,配套框架和代码全部开源。开发门槛大幅降低,创新速度会快很多。
开源和闭源的差距,还有多大?
这个问题,今年被反复讨论。
DeepSeek 的答案是:在 Agent 场景里,差距正在快速缩小。
Vision-Exp 的多模态 Agent 能力已经逼近 Opus-4.8,而价格是闭源模型的几分之一。加上 Harness 框架的开源,开发者可以基于 DeepSeek 的基座,快速搭建自己的多模态 Agent 应用。
但差距也不是完全不存在。
Vision-Exp 目前还是实验版本(Exp),生产稳定性需要后续版本或自建工程补齐。304.6B 的总参数、48 个权重分片,部署门槛不低,不是普通消费级显卡能跑的。
通用视觉能力(比如复杂街景中的小目标识别、精确计数)也还有提升空间。实测中,汽车数量数得不太准,说明幻觉控制仍需优化。
所以更准确的描述是:在特定场景(截图 Agent、图表理解、视觉驱动编码)上,开源模型已经可以和闭源模型掰手腕。在通用视觉能力和工程稳定性上,还有追赶空间。
但追赶的速度,比去年快多了。
DeepSeek 今天这个动作,和年初开源 V3 时的逻辑一脉相承:
不是只给你用,是让你看懂、让你改、让你基于它做自己的事。
从 V3 到 V4-Flash,从 Harness 到 Vision-Exp,DeepSeek 正在构建一条完整的开源 Agent 链路。
模型负责想,Harness 负责做,Vision 负责看。
全部开源。
对于开发者来说,这不是"又多了一个模型可选"。这是"终于有一套完整的开源基础设施,可以用来构建真正的多模态 Agent"。
剩下的,就是看大家怎么用了。#DeepSeek[超话]##ai创造营#
