#DeepSeekV4多模态模型正式开源#
就在刚刚,DeepSeek 把 DeepSeek-V4-Flash-Vision-Exp 正式放上 Hugging Face,并采用 MIT License 开源。
我觉得这件事真正重要的,不是“又多了一个开源模型”,而是 DeepSeek 开始把多模态这块也往开源生态里推了。
8 月 21 日这个模型刚上线 API 时,它更像是一次能力预告:给 V4-Flash 装上视觉,让模型不只会读文字,还能看截图、图表、网页,再结合工具完成任务。现在权重和推理代码直接开放,意义就完全不一样了——开发者可以自己部署、微调、魔改,企业也更容易基于它做自己的视觉 Agent。
而且它不是那种“为了多模态,把原本能力削弱一截”的模型。官方数据里,Terminal Bench 2.1 做到 83.9,DeepSWE 59.3;多模态 Agent 的 Agents’ Last Exam 27.3、ZeroBench 35.0,部分指标已经和 Opus-4.8 打得非常近,甚至出现反超。更关键的是,纯文本 Agent 能力基本没有因为加入视觉而掉下来。
所以我更愿意把这次开源看成一个信号:大模型竞争正在从“谁聊天更聪明”,继续往“谁能看懂真实世界,并且替你把事情做完”迁移。
过去开源模型主要解决的是“脑子能不能拿走”,现在开始连“眼睛”也一起交出来了。
多模态 Agent 真正卷起来,可能才刚开始。
发布于 重庆
