DeepSeek于2026年8月31日在Hugging Face正式开源了V4家族首款多模态模型——DeepSeek-V4-Flash-Vision-Exp,采用MIT协议全量开放权重与核心代码,而大家更关心的是:后续会推出参数规模更大的版本吗?
一、V4多模态路线初步成型
首款实验性多模态模型:DeepSeek-V4-Flash-Vision-Exp基于V4-Flash架构加入视觉模块,经持续训练获得图像理解能力。
全链路开源:公开模型权重、Tokenizer、Prompt编码参考实现及最小化PyTorch推理代码,覆盖视觉编码器、Aligner、MoE等核心模块。
显式标注实验性质:官方明确标注“Exp”版本,意味着仍处迭代期,为后续正式版留出空间。
二、多模态能力大幅跃升但文本能力不减
多模态Agent接近顶级:在ApexBench得分36.5、ZeroBench得分35.0,多模态Agent能力已接近Opus-4.8。
纯文本能力保持持平:Terminal Bench达83.9、DeepSWE达59.3,加入视觉模块未牺牲原有推理与Agent能力。
极具竞争力的成本:图片Token上限仅384个,单请求最多处理600张图,价格与V4-Flash一致,高峰期百万输入Token仅3元。
三、后续更大参数版本展望
定位为V4家族首款:该模型是V4系列第一款实验性多模态模型,意味着多模态能力将覆盖整个V4家族。
对标Pro级模型:此前V4-Pro总参数达1.6万亿、激活参数490亿,按DeepSeek产品节奏,更大参数的多模态版本存在明确落地空间。
迭代节奏印证:DeepSeek从4月发布V4预览版,到7月Flash正式版、8月Pro正式版,再到如今的多模态Exp,节奏密集,后续极大概率推出基于V4-Pro的多模态版本,或专为视觉任务优化的更大规模模型。