DeepSeek V4 Pro正式版上线不到24小时官网便撤回公告,这款定位旗舰的模型与轻量级V4 Flash在参数规模、定价和场景定位上差异明显,但实际第三方评测的体感差距远小于预期,引发“发错模型”或“部署失误”的猜测。
一、上线即撤回:一场24小时内的反转
低调上线:8月12日深夜,DeepSeek静默更新API文档,将V4 Pro从预览版转为正式版(版本号DeepSeek-V4-Pro-0813),没有任何发布会或预热公告。
紧急撤回:13日上午,官网首页横幅和开放平台公告被悄然撤下,但API文档中模型名称与定价信息仍保留,形成“半撤回”的尴尬状态。
官方沉默:截至13日晚,DeepSeek官方未就撤回原因发表任何声明,外界只能通过接口指纹变化和用户反馈拼凑信息。


二、V4 Pro vs V4 Flash:参数、定价与定位对比
- 对比维度
- V4 Pro (0813)
- V4 Flash (0731)
- 总参数1.6万亿(MoE)2840亿(MoE)
- 激活参数490亿约130亿
- 上下文窗口100万 token100万 token
- 最大输出38.4万 token未明确公开
- 定价(输入/输出,每百万token)3元 / 6元1元 / 2元
- 缓存命中输入0.025元0.02元
- 并发限制5002500
- 核心定位复杂推理、长上下文、Agent任务高频调用、性价比优先
参数差距巨大:Pro的总参数是Flash的5.6倍,激活参数是3.8倍,理论上推理能力更强。
定价为Flash的三倍:Pro输出价格6元/百万token,是Flash(2元)的3倍,缓存命中输入也略高。
并发限制更低:Pro仅支持500并发,面向深度推理场景;Flash支持2500并发,适合高吞吐量业务。
三、实际表现:跑分亮眼,体感平淡
官方跑分异常亮眼:在Terminal-Bench 2.1上,Pro拿到87.9分,仅比Claude Fable 5低0.1;DeepSWE得分从预览版的12.8猛增至62.7。
第三方评测泼冷水:Artificial Analysis智能指数Pro仅53分,只比Flash的52分高1分,与GLM-5.2持平,落后Kimi K3约7分。
开发者普遍感受落差:许多用户反馈在复杂任务中Pro表现与Flash无明显区别,甚至出现推理早停、思维链断裂等问题,加剧了“后端部署错误”的猜测。