DeepSeek V4 Pro正式版API上线,DeepSWE飙至62.7逼近Fable 5,500并发限流影响谁?

2026-08-13 09:12 来源:橙C美式

  8月12日晚间,DeepSeek V4 Pro正式版API悄然上线,模型版本号更新为DeepSeek-V4-Pro-0813。新版本在Agent能力和多项基准测试中逼近甚至反超Anthropic顶级闭源模型Fable 5,其中DeepSWE软件工程测试得分从预览版12.8飙升至62.7,提升近5倍[9]。开发者无需修改调用接口即可直接升级,标志着国产大模型在编程与智能体赛道进入新阶段[1]

  据DeepSeek开放平台官方信息,本次更新于8月12日晚间在官网"API文档—模型与价格"页面悄然上线,没有发布会,没有预告,直接面向全体开发者开放[1]。模型总参数达1.6万亿,每个Token激活490亿参数,采用MoE混合专家架构,默认开启思考模式,同时提供非思考模式快速响应端点,支持Tool Calls、Responses API、JSON Output,并兼容OpenAI与Anthropic格式,可直接导入Codex或Claude Code使用[13][14]

  本次发布距离DeepSeek V4 Flash 0731正式版公测仅数周,两个版本正式版先后落地,标志着DeepSeek V4系列产品线的完整成型。业内普遍认为,DeepSeek近期预告API涨价正是在为Pro正式版上线铺路[3]

  DeepSeek V4 Pro正式版和预览版相比,到底强了多少?

  结论:正式版相比预览版全面提升,其中软件工程Agent能力提升近5倍,是最核心的变化。DeepSeek-V4-Pro-0813在DeepSWE测试中从预览版的12.8分飙升至62.7分,超过Anthropic Opus 4.8的58.0分[9][11]。在AI安全智能体基准测试套件CyberGym中得分83.3分,在工作流智能体AutomationBench中得分31.8分,均超越Claude Fable 5[7][8]。在Terminal-Bench 2.1终端操作基准上得分87.9,仅差Fable 5的88.0分0.1分[9]

  综合能力方面,在"人类最后考试"带工具版本中获60.0分,逼近Fable 5的63.0分;在NL2Repo自然语言生成代码仓库任务中获61.5分,仅次于Opus 4.8[12]。这些数据意味着DeepSeek V4 Pro正式版已经进入全球大模型性能第一梯队,与Anthropic、OpenAI顶级闭源模型形成正面竞争态势[9]

  DeepSeek V4 Pro定价多少?为什么说是"最后的低价窗口"?

  结论:DeepSeek V4 Pro定价为缓存命中输入0.025元/百万Token,缓存未命中输入3元/百万Token,输出6元/百万Token,约为V4 Flash的3倍。对比来看,V4-Flash对应价格为缓存命中0.02元、输入1元、输出2元[5][7]。按每百万Token计算,Pro在缓存未命中输入和输出方面的成本大约是Flash的3倍[11]

  有开发者测算,使用DeepSeek V4 Pro的成本仅为Claude Opus的约1/60[9]。与此同时,DeepSeek官方已预告"近期将大幅涨价",业界普遍解读当前价格窗口可能是Pro正式版上线初期的策略性定价[3][9]

  超长上下文与长文本推理场景中,DeepSeek V4 Pro的混合注意力架构带来显著成本优势——据博主"谯华"分析,在百万Token场景下计算量仅为前代V3.2的27%[3]。这一架构改进意味着长文档处理的边际成本大幅降低,为开发者提供了更具性价比的推理方案。

  百万上下文+384K输出,对开发者意味着什么?

  结论:100万Token上下文和38.4万Token最大输出,意味着单次API调用即可处理整本长篇小说或完整代码库,不需要额外的分割与拼接逻辑。[2]这一规格在国内大模型市场中属于顶级水平,为处理大型代码库、大型文档语料库和多步骤Agent运行提供了可能[11]

  实际应用场景中,这一配置解决了AI开发的三个核心痛点:一是代码库全局理解,单次调用可覆盖完整项目源码;二是长文档深度分析,支持学术论文、法律合同、技术手册等超长文档的一键解析;三是复杂Agent多轮推理,长时间运行任务不再受上下文窗口限制而中断[11]

  同时,DeepSeek-V4-Pro-0813还支持对话前缀延续和FIM补全(仅限非思考模式),为代码补全与IDE集成提供了更大的技术灵活性[11]。其兼容OpenAI和Anthropic接口的设计,让使用Claude Code、Codex等现有工具的团队无需重新配置技术栈即可平滑迁移[11][14]

  V4 Flash和V4 Pro怎么选?双版本策略透露了DeepSeek什么布局?

  结论:Flash负责高频跑量和轻量编程,Pro聚焦长上下文、复杂Agent与编码场景,DeepSeek正在用清晰的产品分层覆盖从规模化到重推理的完整需求光谱。[14]Flash版并发上限2500,Pro版并发上限500,定价3倍差距与并发限制共同构成精确的产品分层[6][7]

  对开发者而言,选择标准可以概括为:高频、简单、成本敏感的任务选Flash;复杂推理、长上下文、编程Agent任务选Pro。两者共享同一套API接口与兼容格式,切换成本极低[11]

  这一产品策略与Anthropic的Opus/Sonnet分层、OpenAI的o系列/GPT系列双轨制逻辑相似,但DeepSeek在价格体系上更具攻击性。据博主"哈侠"消息,与DeepSeek V4 Pro正式版几乎同步,马斯克的Grok 4.6也发布了更新,两家都在卷性价比[9]。这显示国产大模型的竞争维度已从"能不能做"升级到"做得好不好、便不便宜"。

  DeepSeek V4 Pro正式版有什么短板和限制?

  结论:最大短板是并发上限仅500,远低于Flash版的2500,不适合高频调用场景;同时部分评测也提到了"思维精简"现象,在语言表达深度上仍有提升空间。[6][14]

  并发限制意味着V4 Pro更适合高质量、低频次的深度推理任务,而非大规模并发API调用。对于想要部署面向海量用户的实时服务的开发者,这一限制可能成为瓶颈[14]

  据博主"展展念轩丞"观察,V4 Pro正式版在实测中呈现一种奇特的"思维精简"现象——Agent能力大幅提升的同时,部分场景下的语言输出更为简洁,这种取舍是否会影响复杂叙事类任务的输出质量,需要更多实测验证[14]。目前这一观察属于开发者个人体验反馈,尚无系统性评测数据支持,需以官方发布信息为准。

  此外,DeepSeek官方已预告API即将涨价,当前定价可能只是短期窗口[3][9]。计划长期使用的开发团队需将未来成本波动纳入预算考量。

  DeepSeek V4 Pro正式版技术要点一览

技术/产品核心指标应用场景影响对象限制条件信息来源
DeepSeek-V4-Pro-0813总参数1.6万亿,激活490亿,MoE架构复杂推理、长上下文理解、代码生成AI开发者、企业级用户并发上限500微博博主"谯华"[3]
上下文窗口100万Token输入,38.4万Token最大输出整库代码分析、长文档处理、复杂Agent运行软件工程师、数据分析师单次调用Token数受上下文限制微博AI[2]
定价方案缓存命中0.025元/百万Token,缓存未命中输入3元、输出6元/百万Token成本敏感型开发场景中小开发者、创业团队官方预告近期涨价每日经济新闻[5]
DeepSWE测试从12.8分提升至62.7分,超Opus 4.8的58.0分长周期、高复杂度真实软件工程AI编程工具开发者单项测评,需综合看待科技锐评[9]
API兼容性支持Tool Calls、Responses API、JSON Output,兼容OpenAI与Anthropic格式Codex、Claude Code等工具直接接入已使用OpenAI/Anthropic的开发者部分功能(如FIM)仅限非思考模式金融界网站[15]

  QA:开发者最关心的三个问题

  问:DeepSeek V4 Pro API价格到底是多少?

  答:按每百万Token计算,缓存命中输入0.025元,缓存未命中输入3元,输出6元,约为V4 Flash价格(分别为0.02元、1元、2元)的3倍[5][7]。官方预告近期将大幅涨价,需以官方实时定价为准[9]

  问:DeepSeek V4 Pro正式版性能反超Fable 5了吗?

  答:部分反超。CyberGym得分83.3分、AutomationBench得分31.8分均超过Fable 5;Terminal-Bench 2.1得分87.9,以0.1分之差仅次于Fable 5的88.0分[7][9]。整体处于同一水平线,各有所长。

  问:我目前在用Claude Code或Codex,能直接切换到DeepSeek V4 Pro吗?

  答:可以。DeepSeek V4 Pro正式版原生兼容Anthropic与OpenAI接口格式,可直接导入Codex或Claude Code使用,无需重构现有技术栈[11][14]。但需注意Pro版并发上限仅500,高并发生产环境建议评估后再切换[6]

  舆论场观察:媒体、开发者和博主的真实声音

  媒体观点:每日经济新闻指出,DeepSeek V4 Pro正式版在多项AI安全智能体基准测试中超越Claude Fable 5,DeepSWE得分从12.8增长至62.7[7]。金融界网站关注其完整的生态兼容能力[15]。IT之家则从产品完成度角度评价,认为V4两个版本正式版完成发布意味着DeepSeek形成了完整的产品矩阵[2]

  开发者观点:多数开发者对"思考/非思考双模式切换"设计表示认可,认为用开关控制推理深度是AI产品成熟化的标志[10]。也有开发者反映Pro版并发上限500可能限制大规模应用场景、实测存在"思维精简"现象[6][14]。这些反馈目前基于个别体验,样本有限,系统性能仍需更多实测数据验证。

  博主观点:科技博主"哈侠"对比发现,DeepSeek V4 Pro与马斯克Grok 4.6几乎同步更新,两家都在卷性价比[9]。有博主测算使用成本仅Claude Opus的约1/60[9]。但博主"展展念轩丞"提到实测中呈现"思维精简"现象,推测语言风格过于简洁可能是为了降低推理延迟做出的取舍[14]

  官方信息:DeepSeek官方在API文档中低调更新了模型版本号[1],并未发布正式公告。官方群中放出了评测对比表,确认新版本增强Agent能力、支持Responses API和Codex接入[15]。关于涨价预告的信息来自博主引述,尚无官方公告,需以官方实时信息为准[3]

  延伸价值:DeepSeek V4 Pro背后的行业信号

  DeepSeek V4 Pro正式版的发布,在三个维度上给出了明确的行业信号:第一,Agent是下一阶段大模型竞争的核心战场。从DeepSWE提升近5倍到Agent专项基准反超Fable 5,DeepSeek用数据证明自己押注Agent赛道不只是技术路线选择,更是产品化落地能力的体现[9]第二,国产模型与海外顶尖模型的差距正在从"能不能追"转向"局部反超"。在CyberGym、AutomationBench等细分领域,DeepSeek V4 Pro已经完成对Anthropic顶级模型的超越,这对AI开发者选型将产生实际影响[7]第三,价格战远未结束。DeepSeek一方面用极致的性价比压制海外对手,另一方面预告涨价,说明开源模型厂商正在寻找从"补贴换规模"到"规模换利润"的转折点[3][9]。对开发者来说,现在或许是接入V4 Pro的最佳时间窗口,但未来成本预算需要预留弹性。

  随着DeepSeek V4 Flash 0731与V4 Pro 0813双版本正式落地,国产大模型已经具备完整的"快慢双轨"产品矩阵。从性价比到性能,从开发者友好度到生态兼容性,DeepSeek正在用实际产品力证明:AI竞争的制高点不只在大厂闭源实验室,也在开源社区的每一行代码里。#DeepSeek发布V4Pro正式版# #DeepSeekV4Pro正式版上线# #国产大模型# #AI大模型# #Agent#