DeepSeek 于 2026 年 8 月 31 日在 Hugging Face 正式开源了 V4 家族首款多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT 许可协议,普通开发者完全具备本地部署的条件与可能。
一、开源即部署:模型开放程度极高
完整开源:本次开源不仅公开模型权重,还一并放出 Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理代码,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块,开发者拿到手即可自行部署与二次开发。
宽松许可:采用 MIT License,允许商用、本地部署与自由修改,几乎没有授权壁垒,中小团队和个人开发者均可无负担使用。
实验版本定位:官方明确标注为 “Exp” 实验版本,属 V4 家族第一款实验性多模态模型,开发者可在真实业务场景中充分实测验证。
二、部署门槛:硬件要求与量化方案
参数规模:模型总参数约 305B,但采用 MoE 架构,每个 Token 仅激活 13B 参数,这大幅降低了推理时的显存占用与计算开销。
显存需求:完整精度部署仍需要较高显存,但开源社区已出现多种量化版本与 LoRA 微调方案,配合 FP8 等混合精度技术,消费级显卡本地运行已具备可行性,当前 SGLang 等推理框架已跟进支持。
部署适配:SGLang 正在开发配套支持方案,DGX Spark 定制版本也已提上日程,硬件适配生态正快速完善,开发者无需等待官方 SDK 即可完成本地部署。
三、部署价值:视觉 Agent 与文本能力兼得
多模态能力跃升:模型在多模态 Agent 基准测试中表现突出,ApexBench 得分 36.5,ZeroBench 得分 35.0,多模态 Agent 能力已接近或反超 Opus-4.8。
文本能力不缩水:加入视觉模块后,纯文本任务性能与 V4-Flash 正式版持平,Terminal Bench 达 83.9,DeepSWE 达 59.3,原有推理、代码与 Agent 能力完整保留。
落地场景广阔:开发者可基于本地部署构建电商商品图识别、教育拍题讲解、医疗影像辅助、截图 UI 还原等应用,彻底摆脱多模态 API 的按次计费成本压力。