DeepSeek V4 Pro的Agent能力提升了多少?

2026-08-13 04:16 来源:代码浪潮记

  DeepSeek V4 Pro正式版(版本号0813)于8月12日晚间低调上线API,其Agent能力迎来质的飞跃——在DeepSWE软件工程基准上从预览版的12.8飙升至62.7,多项核心测试逼近甚至超越Anthropic的Claude Fable 5,但价格仅为后者的几十分之一。

  

  一、Agent基准测试全方位跃升

  DeepSWE暴增近5倍:软件工程基准从预览版12.8跃升至62.7,涨幅达390%,标志着模型在长周期、高复杂度真实编程任务中的自主执行能力取得质变。

  全面逼近Fable 5:Terminal Bench 2.1得分为87.9(Fable 5为88.0),Cybergym达83.3(超越Fable 5的83.1),AutomationBench达31.8(全面领先Fable 5的29.1)。

  超越Opus 4.8:在DeepSWE、Terminal Bench、Cybergym、AutomationBench等关键项目上均超过Claude Opus 4.8,综合Agent能力已稳居全球第一梯队。

  二、Agent开发功能全面补强

  双模式支持:默认开启思考模式用于复杂推理,同时提供非思考模式满足低延迟响应,开发者可按任务难度“选档位”使用。

  开发生态兼容:原生支持Tool Calls、Responses API和Anthropic API,可直接导入Codex使用,开发者切换零迁移成本。

  百万级上下文支撑:支持100万Token超长上下文输入和38.4万Token最大输出,单次调用即可处理整份大型代码仓库或多步Agent执行流程。

  

  三、极致性价比锁定Agent赛道

  价格断层优势:缓存未命中输入3元/百万Token、输出6元/百万Token,仅为Fable 5调用成本的几十分之一;缓存命中时输入低至0.025元/百万Token。

  产品矩阵清晰:Pro版本并发上限500,聚焦高难度推理与复杂Agent任务;Flash版本并发上限2500,主打高频低延迟场景,形成差异化覆盖。

  价格即将上调:官方已预告API服务近期将整体涨价且“涨幅较大”,当前价格窗口可能是低成本接入Pro Agent能力的最佳时机。