DeepSeek在8月12日深夜悄然将V4 Pro预览版升级为正式版(版本号0813),Agent能力迎来近5倍暴涨,多项智能体测试逼近甚至反超Anthropic的旗舰模型Claude Fable 5,而价格仅为其几十分之一。

一、Agent能力实现质的飞跃
DeepSWE指标爆发式增长:正式版在代码修复基准DeepSWE上从预览版的12.8%飙升至62.7%,接近5倍提升,这是最硬核的升级亮点。
逼近并反超顶级闭源模型:在Terminal Bench 2.1上拿到87.9分,仅比Fable 5低0.1分;在CyberGym安全智能体评测中以83.3分反超Fable 5;在AutomationBench等多项智能体测试中同样超过Opus 4.8等竞品。
智能体全能力线普涨:相比7月31日发布的V4 Flash正式版,Pro-0813在NL2Repo、CyberGym、DeepSWE、AutomationBench等维度全线大幅提升。

二、超长上下文与大输出能力落地
百万级上下文窗口:支持100万token上下文(可处理整本《三体》体量的长文本),最大输出达38.4万token,单次调用即可摄取和生成海量内容。
双模式灵活切换:支持思考模式(强化复杂推理)与非思考模式(低延迟响应),开发者可根据任务类型自由选择。
完整工具链支持:原生支持Tool Calls、Responses API、Anthropic API兼容接口以及FIM补全等开发者所需的核心功能。
三、阶梯定价与清晰商业化定位
价格维持不变但涨价预警:正式版API定价仍为输入3元/百万token(缓存未命中)、输出6元/百万token,是Flash版本的三倍,但官方已明确预告近期将大幅涨价。
并发限制区分产品层级:Pro版本并发上限压缩至500(Flash为2500),明确聚焦高价值复杂任务(深度代码审查、长文档分析、多步Agent流程),而非通用轻量调用。
极致性价比冲击市场:同等性能下成本仅为Fable 5的几十分之一,与同日发布的Grok 4.6形成正面竞争,推动前沿模型价格战进入新阶段。