#DeepSeekV4多模态模型正式开源#DeepSeek V4家族首款多模态实验模型正式开源了,模型DeepSeek‑V4‑Flash‑Vision‑Exp上传Hugging Face,采用MIT协议,开发者可以直接拿来本地部署、二次开发。
这个模型不是简单给大模型加个看图能力,它的核心定位偏向多模态Agent。在原有V4‑Flash强悍文本推理基础上新增视觉模块,既能看懂截图、图表、软件界面,还能结合工具调用自动完成任务。
有意思的是该模型十天前就已经上线API接口对外可用,现在完整开源,相当于把这套“能看画面干活”的能力彻底交到开发者手上。从跑分数据来看,升级视觉之后,原有Agent能力不降反升,多项测试指标甚至对标海外顶尖模型。
不过也要客观看待,它目前依旧属于实验版本,并不是成熟稳定的正式版。开源不等于开箱即用,本地部署对硬件配置有门槛,普通用户很难直接体验,利好更多是面向开发者、技术团队。
现在各家大模型都在卷多模态,但是很多只停留在看图问答。DeepSeek这次重点放在Agent自动执行任务这个方向,算是差异化路线。能看懂画面还能动手干活,这才是多模态真正的价值,期待后续看到更多基于它衍生出来的应用。
你们觉得带视觉能力的Agent,会是接下来大模型的主流方向吗?http://t.cn/AX0wmZZv
发布于 江苏
