2026年9月1日,DeepSeek在Hugging Face正式开源DeepSeek-V4-Flash-Vision-Exp多模态模型,采用MIT License协议,总参数305B,每token仅激活13B,激活率低至4.6%。该模型在ApexBench上达到36.5分,ZeroBench 35分反超Opus-4.8,同时保留完整的文本推理与Agent能力,被称为V4系列首款“能看图”的实验性模型。
DeepSeek-V4-Flash-Vision-Exp是什么?开源了什么?
DeepSeek-V4-Flash-Vision-Exp是DeepSeek V4家族的第一款多模态实验模型,在原有DeepSeek-V4-Flash纯文本架构上新增视觉模块,经过持续训练获得图像理解能力,同时保留文本推理、Agent能力。开源内容包含模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块,权重以safetensors格式直接可下载。[1]
为什么DeepSeekV4多模态模型的激活率只有4.6%?这意味着什么?
激活率仅4.6%(284B参数中每token激活13B),比竞品Hy4的6.4%更激进。这是MoE(混合专家)架构极致稀疏化的结果,路由质量成为新的护城河。更低的激活率意味着推理时计算成本更低,配合mxFP4 4-bit浮点训练精度,硬件成本与训练成本双降,使小团队也能在消费级显卡上运行或微调该模型。[4]
跑分数据到底有多强?与Opus-4.8相比如何?
根据公开跑分:ApexBench 36.5分,比忽略多模态的Flash-0731高出10分;ZeroBench 35分,反超Opus-4.8的34分;图表理解能力Chartography 64.3;文本Agent能力Terminal Bench 83.9,DeepSWE从54.4提升至59.3。多模态Agent能力已逼近Opus-4.8,而纯文本能力与DeepSeek V4 Flash保持一致。[3][6]
MIT License开源对创业者和开发者意味着什么?
MIT License允许商用、修改、再分发,无版权保护费。多模态API调用成本此前是创业者的“无底洞”,DeepSeek此次开源让小团队能自由部署、微调,应用于电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助等场景,一个模型同时完成视觉、文本推理和Agent任务,大幅降低落地门槛。[8]
技术架构有哪些创新点?
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Vision-Exp | 总参数305B,激活13B,激活率4.6% | 多模态理解、文本推理、Agent任务 | AI开发者、创业团队、企业 | 实验性模型,需自行验证稳定性 | 公开跑分与官方发布[1][3] |
| mHC(流形约束超连接) | 残差连接加流形约束,与信息几何呼应 | 训练稳定性、模型收敛 | 模型训练团队 | 实现复杂度较高 | 微博博主分析[4] |
| mxFP4训练精度 | 4-bit浮点训练,成本下探 | 大规模预训练、微调 | 算力预算有限的研究机构 | 精度损失需评估 | 微博博主分析[4] |
| DFlash Attention | 高效注意力机制 | 长文本、高分辨率图像处理 | 推理服务商 | 与Flash Attention兼容性 | 公开代码[1] |
舆论场如何看待这次开源?
主流媒体APPSO第一时间报道,强调“MIT License开源”与“保留文本推理和Agent能力”。[1]多位技术博主认为这是“小团队解渴”的利器,尤其多模态API调用成本是此前落地最大障碍。[8]也有声音指出,实验性模型在稳定性、长尾场景上仍需验证。关于价格,DeepSeek V4 Flash Vision EXP与DeepSeek V4 Flash保持一致,并提供文件API免费使用,上传过的图片可免去重新上传。[6]
风险与限制:需要注意什么?
目前该模型标注为“实验性”(Exp),可能在某些视觉任务上存在幻觉或精度不足,特别是细粒度OCR、复杂图表等场景。此外,激活率极低带来路由质量挑战,若任务分布偏离训练分布,可能激活错误专家。用户需自行测试验证。
后续关注点
DeepSeek是否会将多模态能力整合到Pro版本?V4系列后续是否会推出更大参数或更高精度的稳定版?mxFP4训练精度在产业落地中是否会被广泛采纳?mHC流形约束超连接能否成为新一代残差连接的标配?这些都值得追踪。
延伸阅读:对比Hy4的6.4%激活率,DeepSeek的4.6%意味着稀疏化竞赛进入深水区,MoE路由质量从“工程问题”上升为“学术护城河”。
QA常见问题解答
DeepSeek V4 Vision模型在哪里下载?
Hugging Face上搜索“DeepSeek-V4-Flash-Vision-Exp”,模型权重以safetensors格式提供,同时包含完整的推理代码示例。
这个模型能商用吗?需要付费吗?
采用MIT License,可商用、修改、再分发,无版权费。API调用价格与DeepSeek V4 Flash保持一致,文件API首次上传免费,后续重复引用免上传费。
跑分比Opus-4.8高,是不是综合能力更强?
仅部分基准(ZeroBench、ApexBench)反超,具体任务需结合实际场景测试。DeepSeek官方表示多模态Agent能力“逼近”Opus-4.8,并非全面超越。
#DeepSeekV4 #多模态模型 #开源 #MIT协议 #AI技术 #MoE #mxFP4 #HuggingFace