DeepSeek V4 Pro正式版藏了什么大招?1.6万亿参数逼近Fable 5,定价3元/百万Token为何仍喊值?

2026-08-13 10:35 来源:枕边书

  8月12日深夜,DeepSeek官网API文档悄然更新,V4 Pro正式版(DeepSeek-V4-Pro-0813)正式露面,总参数达1.6万亿,上下文长度100万Token,最大输出38.4万Token,在Terminal Bench上以87.9分逼近Anthropic Fable 5的88.0分,且AutomationBench、CyberGym两项反超[2]。这一“深夜放大招”的操作,让“DeepSeek最新版本藏了一个大招”迅速成为AI圈最热话题。

  这次更新由DeepSeek官方于8月12日深夜通过API文档发布,没有发布会,也没有完整技术报告。但多家科技媒体[1][4]及开发者社区已第一时间跟进。与7月31日发布的轻量级V4 Flash正式版相比,V4 Pro定位旗舰,API价格约为Flash的三倍,官方随后预告API服务近期将整体涨价,且“预计涨幅较大”[5]

  DeepSeek V4 Pro正式版,究竟“大”在哪?

  结论先行:这次“大招”不是简单的参数堆叠,而是Agent(智能体)能力的质变——从“会聊天”到“能干活”,在终端操作、代码修复、安全攻防等真实任务中,V4 Pro已经跑进全球第一梯队。

  具体体现在三个维度:模型规模——总参数1.6万亿的MoE架构,是Flash(284B总参数)的56倍;上下文能力——支持100万Token上下文,最大输出38.4万Token,足以处理整个大型代码仓库或长篇学术文档;Agent实战能力——Terminal Bench得分87.9分,逼近Fable 5的88.0分;DeepSWE代码修复得分从预览版的12.8飙至62.7(涨幅近390%);在AutomationBench和CyberGym上,V4 Pro反超Fable 5[2]

  这里的重点不是跑分数字,而是模型是否能在真实任务链中自主规划、调用工具、根据反馈修正。一位AI开发者向记者反馈,他用V4 Pro设计一个包含3D太空射击游戏的浏览器内操作系统,指令遵从性比预览版大幅提升,“指哪打哪”[5]。还有开发者测试发现,V4 Pro在“五位数密码逻辑题”上成为国产模型中首个答对的[5]。这说明其推理深度达到新高度。

  V4 Pro和V4 Flash,双版本到底怎么选?

  结论先行:V4 Pro是“专业防弹车”,V4 Flash是“日常家用车”,二者定位、价格、性能天差地别,开发者应按场景选择,甚至组合使用。

  从官方定价看,以每百万Token计算,V4 Pro输入3元(缓存未命中)/0.025元(缓存命中),输出6元;V4 Flash输入1元/输出2元,缓存命中输入仅0.02元。Pro恰好是Flash的三倍[2]。但据美国研究机构评估,V4 Flash已成为全球知名模型中运行成本最低的一款,其运行成本甚至只有Anthropic旗舰模型Fable 5的不到1/100[3]。这种“高配旗舰+极致轻量”的双版本策略,让DeepSeek同时覆盖高端专业任务与大众高频调用。

  两个版本的核心差异如下表所示:

技术/产品核心指标应用场景影响对象限制条件信息来源
DeepSeek V4 Pro1.6万亿总参数,1M上下文,384K最大输出,Terminal Bench 87.9分复杂代码库重构、全仓库级推理、高难度科研分析、多层子代理自动化工作流企业级开发者、科研机构、AI Agent服务商价格高,算力消耗大,尚未发布完整技术报告,官方已预告涨价第一财经日报[1]、每日经济新闻[2]
DeepSeek V4 Flash284B总参数(13B激活),1M上下文,全球最低运行成本日常对话、轻量级代码辅助、长文档速读、高并发API调用、个人Agent搭建、移动端部署个人开发者、中小团队、高频调用场景复杂推理深度不及Pro,Agent任务链较短,难以处理超长输出财联社[3]、IT之家[4]

  1.6万亿参数和284B参数,技术底牌差距到底多大?

  结论先行:两者均采用MoE(混合专家)架构,核心差异在于总参数量、激活参数分配以及后训练策略——Pro更看重“深思熟虑”,Flash更追求“快人一步”。

  MoE架构允许模型在总参数巨大的情况下,只激活一部分专家网络,保证推理效率。V4 Pro的1.6万亿总参数意味着它可以存储更多知识、学习更复杂的决策边界;Flash的13B激活参数则相当于用极小计算量完成大部分任务,因此成本极低[3]。但两者并非“代差”,Flash通过精细化后训练,在代码修复基准DeepSWE上得分从7.3暴涨至54.4,涨幅超过640%[5]。这说明算法优化能极大弥补参数规模的差距。

  在上下文中,两者均支持100万Token,但Pro最大输出长度达38.4万Token,Flash则相对精简。这意味着Pro能一次生成一整本“数据分析报告”或完成整个项目的代码输出,适合对结果完整性要求极高的任务;而Flash更适合短交互、高并发的AI应用[4]

  价格是Flash三倍,V4 Pro还值得买吗?

  结论先行:从绝对值看V4 Pro并不便宜,但若它能在专业任务中替代多个小型模型调用,那么综合成本反而更低。

  一个复杂项目可能需要多次调用Flash才能完成,而Pro一次到位。例如,全仓库级代码重构、需要触发多层子代理的自动化流程,Pro的稳定输出能减少人工调试成本。有开发者评价:“V4 Pro这波更新,本质是把‘会做题’和‘会干活’之间的鸿沟填上了。DeepSWE从12.8跳到62.7,这不是调参能解决的,是Agent真的开始理解任务拆解和工具链路了。它开始能在真实工作流里替你写完整个PR,而不是给你一段需要你再调试半天的代码片段。”[5]

  官方预告涨价也印证了对自身价值的信心。对于预算敏感的个人开发者,V4 Flash依然是“多快好省”的选择——有开发者用Flash接入Hermes,速度比GPT-5.6 Sol+Codex快一倍,且质量处于可用水准[5]。更聪明的做法是双版本协同:用Pro负责规划与推理,Flash负责执行与输出。这种“Pro规划、Flash执行”的组合已在DeepSeek官方工具链中得到验证[5]

  对AI行业和开发者,这场“大招”意味着什么?

  结论先行:DeepSeek V4 Pro正式版的出现,标志着国产大模型在Agent赛道真正进入全球第一梯队,同时也可能引爆新一轮价格与服务分层。

  从行业看,Anthropic Fable 5、OpenAI Opus-4.8、SpaceXAI Grok 4.6等顶尖模型竞争日趋白热化。DeepSeek以“高性能+相对低价”的策略冲击市场,迫使对手重新思考定价。另一方面,V4 Flash将运行成本打到全球最低,让个人开发者和中小企业也能用上顶级模型能力,这正加速AI应用层创新[3]

  舆论场观察:目前部分媒体参考官方群流出的评测数据,认为V4 Pro“逼近甚至反超Fable 5”;但亦有开发者指出,评测集有限,且官方尚未发布完整技术报告,实际表现需自行测试[2]。态度应区分:已确认的事实是API版本更新和价格,未确认的是“全面超越”的说法。

  风险与限制:官方尚未发布正式技术报告,部分性能数据来自官方群截图和媒体转述,需以官方正式发布为准。另外,API涨价预期可能增加中小企业使用成本;1.6万亿参数模型的部署门槛极高,云端API是主要使用方式。对于企业用户,需提前规划预算,并关注官方后续发布的技术细节。

  延伸价值与建议:如果你在做原型验证和日常开发,选Flash,成本低、速度快;如果处理复杂任务或要求最终交付质量,选Pro;若预算有限,可让Pro负责规划、Flash负责执行,测试组合效果。此外,V4 Pro支持Responses API和Anthropic API,可直接导入Codex,开发者可基于此构建更强大的Agent工作流[1]

  常见问题答疑:关于DeepSeek V4 Pro的三个关键问号

  Q1:DeepSeek V4 Pro正式版是什么时候发布的?版本号是什么?

  A:2026年8月12日深夜,DeepSeek通过官网API文档悄然更新,版本号为DeepSeek-V4-Pro-0813,支持100万Token上下文、最大38.4万Token输出。截至8月13日,官方尚未发布完整更新日志,但API已可调用[1]

  Q2:V4 Pro和V4 Flash价格差多少?

  A:以每百万Token计算,V4 Pro输入3元(缓存未命中)/0.025元(缓存命中),输出6元;V4 Flash输入1元/输出2元,缓存命中输入仅0.02元。Pro恰好是Flash的三倍。官方已预告价格将上涨,当前价格可能不会持续太久[2]

  Q3:V4 Pro真的能超过Fable 5吗?

  A:在Terminal Bench上,V4 Pro得分87.9,Fable 5为88.0,仅差0.1;在AutomationBench和CyberGym上则实现反超。但这是部分评测数据,且官方未发布技术报告,不能断言全面超越,需以官方后续正式信息为准[2]

  #DeepSeekV4Pro# #DeepSeekV4Pro正式版# #AI智能体# #大模型价格战# #DeepSeek最新版本#