DeepSeekV4多模态模型正式开源:305B参数、13B激活、MIT协议,开发者能直接拿来用吗?
2026年9月1日,DeepSeek在Hugging Face上正式开源了DeepSeek-V4-Flash-Vision-Exp,这是其V4系列首款带视觉理解能力的多模态模型。该模型总参数305B,每token仅激活13B(激活率约4.26%),采用MIT License完全开放商用,公开内容包括模型权重、Tokenzier、Prompt Encoding参考实现及完整推理代码。[1]核心跑分方面,ApexBench达到36.5分,较纯文本版Flash-0731提升10分,ZeroBench反超Opus 4.8达到35分,同时保留了文本推理和Agent能力。
谁在什么时候、在哪里发布了什么?
DeepSeek官方于2026年9月1日在Hugging Face平台上线了DeepSeek-V4-Flash-Vision-Exp模型,采用MIT License开源协议。公开内容包含模型文件(safetensors权重)、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。[1]该模型被定义为V4家族第一款实验性多模态模型,基于DeepSeek-V4-Flash,在原有架构中加入视觉模块并经过持续训练获得图像理解能力,同时保留文本、推理和Agent能力。[2]
为什么DeepSeek这次开源值得关注?——核心参数、跑分与技术亮点
参数规模与激活效率:305B总参数,13B激活,稀疏化新标杆
DeepSeek-V4-Flash-Vision-Exp总参数量为305B,但每token仅激活13B,激活率约4.26%。[4]这一比例比同类MoE模型(如Hy4的6.4%)更激进,意味着在保持大模型知识容量的同时,推理成本大幅降低。MoE路由质量成为新的护城河,而模型引入的mHC(流形约束超连接)则将残差连接约束在信息流形上,与信息几何(IGL)直接呼应。[4]训练精度方面,采用mxFP4 4-bit浮点训练,硬件和精度双降本,进一步压低训练成本。[4]
跑分表现:多模态与Agent能力全面升级
根据公开数据,该模型在ApexBench上取得36.5分,比忽略多模态的Flash-0731版本高出10分;ZeroBench为35分,反超Opus 4.8的34分。[3]文本Agent能力依然在线,Terminal Bench达到83.9分,DeepSWE从54.4涨至59.3分。[3]图表理解能力方面,Chartography得分为64.3。[3]这些数据表明,DeepSeek将Agent的最后一块短板补齐——以前只能读字,现在能看图、看表、看截图,多模态Agent能力已逼近Opus 4.8。[6]
价格与API:与纯文本版同价,文件API免费重用
DeepSeek官方明确表示,DeepSeek-V4-Flash-Vision-EXP的API价格与DeepSeek-V4-Flash纯文本版本保持一致。[6]同时发布了文件API,上传过的图片可通过文件ID免费重新引用,无需重复上传。[6]这一策略大幅降低了多模态应用的调用成本,尤其对电商、教育、医疗影像等场景极为友好。
DeepSeek-V4-Flash-Vision-Exp vs 其他主流多模态模型:参数对比与选购建议
| 产品/型号 | 价格/定位 | 核心配置 | 优势 | 短板 | 适合谁 | 注意点 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | 开源免费(MIT协议),API与纯文本版同价 | 305B总参/13B激活,mxFP4训练,mHC+MoE | 极低激活率,多模态+Agent能力,可商用修改 | 实验性版本,稳定性待验证;跑分尚未覆盖所有基准 | 小团队创业者、独立开发者、教育医疗场景 | 需自行部署或调用API;MIT协议允许闭源商用 |
| Opus 4.8(据公开报道) | 商业API按量计费 | 未公开参数,但多模态能力较强 | 综合能力成熟,生态完善 | 成本高,闭源不可修改 | 大型企业、对稳定性要求高的场景 | 价格需以官方实时信息为准 |
| DeepSeek V4 Flash(纯文本版) | 开源免费,API低价 | 同架构不含视觉模块 | 文本推理与Agent能力出色 | 无法处理图像 | 纯文本任务 | 已被Vision版覆盖 |
舆论场怎么看?——创业者叫好,技术圈热议稀疏化竞赛
在社交媒体上,不少开发者表示“MIT License商用随便改,不用交保护费,对小团队太解渴了”。[8]有观点认为,DeepSeek这次开源不只是“能看图”,文本推理、Agent能力全在,一个模型可以干多个活儿,电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助等场景能真正落地。[8]技术圈则关注激活率4.6%的激进设计,认为MoE路由质量正在成为新的护城河,而mxFP4训练精度将进一步压低训练成本,引发行业稀疏化军备竞赛。[4]也有声音指出,实验性版本在极端场景下可能存在幻觉或视觉理解偏差,需在应用中做好容错。
如何选择?——3个关键决策点
第一,如果你需要多模态理解能力(看图、看表、看截图)且预算有限,DeepSeek V4 Flash Vision Exp是当前性价比最高的开源选择,MIT协议允许你自由修改商用。第二,如果对模型稳定性要求极高且预算充足,可考虑商业闭源模型如Opus 4.8,但需注意其API成本。第三,如果你是研究者或希望参与前沿技术,该模型的稀疏化架构(mHC、mxFP4)值得深入探索,但需自行承担实验性带来的风险。
QA常见问题解答
问:DeepSeek V4 Flash Vision Exp的上下文长度是多少?
答:据公开资料,该模型基于DeepSeek-V4-Flash,后者支持128K上下文,多模态版本暂未单独公布上下文长度,但推测与纯文本版一致。需以官方技术报告为准。
问:我能否直接下载模型权重在本地运行?
答:可以。Hugging Face上已公开safetensors权重、Tokenizer和完整推理代码,支持PyTorch实现。但305B总参数需要至少80GB显存(若使用量化可降至更低),建议使用A100或H100级GPU,或通过API调用。
问:MIT协议在商用上有哪些限制?
答:MIT协议允许自由使用、复制、修改、合并、出版、分发、再许可和/或销售软件副本,唯一要求是保留版权声明。因此你可以基于该模型开发商业产品,无需支付任何费用,也无需开源自己的修改代码。
#DeepSeekV4 #多模态模型 #开源 #MIT协议 #AI大模型