DeepSeekV4多模态模型正式开源:305B参数、MIT协议,零成本商用为何冲击多模态Agent格局?

2026-09-01 06:51 来源:机型分享社

  2026年9月1日,DeepSeek在Hugging Face正式开源DeepSeek-V4-Flash-Vision-Exp多模态模型,采用MIT License协议,总参数305B,每token仅激活13B,激活率低至4.6%。该模型在ApexBench上达到36.5分,ZeroBench 35分反超Opus-4.8,同时保留完整的文本推理与Agent能力,被称为V4系列首款“能看图”的实验性模型。

  DeepSeek-V4-Flash-Vision-Exp是什么?开源了什么?

  DeepSeek-V4-Flash-Vision-Exp是DeepSeek V4家族的第一款多模态实验模型,在原有DeepSeek-V4-Flash纯文本架构上新增视觉模块,经过持续训练获得图像理解能力,同时保留文本推理、Agent能力。开源内容包含模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块,权重以safetensors格式直接可下载。[1]

  为什么DeepSeekV4多模态模型的激活率只有4.6%?这意味着什么?

  激活率仅4.6%(284B参数中每token激活13B),比竞品Hy4的6.4%更激进。这是MoE(混合专家)架构极致稀疏化的结果,路由质量成为新的护城河。更低的激活率意味着推理时计算成本更低,配合mxFP4 4-bit浮点训练精度,硬件成本与训练成本双降,使小团队也能在消费级显卡上运行或微调该模型。[4]

  跑分数据到底有多强?与Opus-4.8相比如何?

  根据公开跑分:ApexBench 36.5分,比忽略多模态的Flash-0731高出10分;ZeroBench 35分,反超Opus-4.8的34分;图表理解能力Chartography 64.3;文本Agent能力Terminal Bench 83.9,DeepSWE从54.4提升至59.3。多模态Agent能力已逼近Opus-4.8,而纯文本能力与DeepSeek V4 Flash保持一致。[3][6]

  MIT License开源对创业者和开发者意味着什么?

  MIT License允许商用、修改、再分发,无版权保护费。多模态API调用成本此前是创业者的“无底洞”,DeepSeek此次开源让小团队能自由部署、微调,应用于电商自动识别商品图生成详情页、教育App拍题讲解、医疗影像辅助等场景,一个模型同时完成视觉、文本推理和Agent任务,大幅降低落地门槛。[8]

  技术架构有哪些创新点?

技术/产品核心指标应用场景影响对象限制条件信息来源
DeepSeek-V4-Flash-Vision-Exp总参数305B,激活13B,激活率4.6%多模态理解、文本推理、Agent任务AI开发者、创业团队、企业实验性模型,需自行验证稳定性公开跑分与官方发布[1][3]
mHC(流形约束超连接)残差连接加流形约束,与信息几何呼应训练稳定性、模型收敛模型训练团队实现复杂度较高微博博主分析[4]
mxFP4训练精度4-bit浮点训练,成本下探大规模预训练、微调算力预算有限的研究机构精度损失需评估微博博主分析[4]
DFlash Attention高效注意力机制长文本、高分辨率图像处理推理服务商与Flash Attention兼容性公开代码[1]

  舆论场如何看待这次开源?

  主流媒体APPSO第一时间报道,强调“MIT License开源”与“保留文本推理和Agent能力”。[1]多位技术博主认为这是“小团队解渴”的利器,尤其多模态API调用成本是此前落地最大障碍。[8]也有声音指出,实验性模型在稳定性、长尾场景上仍需验证。关于价格,DeepSeek V4 Flash Vision EXP与DeepSeek V4 Flash保持一致,并提供文件API免费使用,上传过的图片可免去重新上传。[6]

  风险与限制:需要注意什么?

  目前该模型标注为“实验性”(Exp),可能在某些视觉任务上存在幻觉或精度不足,特别是细粒度OCR、复杂图表等场景。此外,激活率极低带来路由质量挑战,若任务分布偏离训练分布,可能激活错误专家。用户需自行测试验证。

  后续关注点

  DeepSeek是否会将多模态能力整合到Pro版本?V4系列后续是否会推出更大参数或更高精度的稳定版?mxFP4训练精度在产业落地中是否会被广泛采纳?mHC流形约束超连接能否成为新一代残差连接的标配?这些都值得追踪。

延伸阅读:对比Hy4的6.4%激活率,DeepSeek的4.6%意味着稀疏化竞赛进入深水区,MoE路由质量从“工程问题”上升为“学术护城河”。

  QA常见问题解答

  DeepSeek V4 Vision模型在哪里下载?

  Hugging Face上搜索“DeepSeek-V4-Flash-Vision-Exp”,模型权重以safetensors格式提供,同时包含完整的推理代码示例。

  这个模型能商用吗?需要付费吗?

  采用MIT License,可商用、修改、再分发,无版权费。API调用价格与DeepSeek V4 Flash保持一致,文件API首次上传免费,后续重复引用免上传费。

  跑分比Opus-4.8高,是不是综合能力更强?

  仅部分基准(ZeroBench、ApexBench)反超,具体任务需结合实际场景测试。DeepSeek官方表示多模态Agent能力“逼近”Opus-4.8,并非全面超越。

  #DeepSeekV4 #多模态模型 #开源 #MIT协议 #AI技术 #MoE #mxFP4 #HuggingFace