北京时间8月12日晚,DeepSeek官网API文档悄然更新,正式上线V4 Pro正式版(DeepSeek-V4-Pro-0813)。该模型以输入3元/百万tokens、输出6元/百万tokens的价格,将DeepSWE得分从预览版12.8提升至62.7,多项Agent测试逼近Anthropic Fable 5。几乎同一时间,马斯克旗下SpaceXAI发布Grok 4.6。两款高性价比模型正面碰撞,给开发者出了一道新的选择题。
这次更新发生在2026年8月12日深夜,地点是DeepSeek官网API“模型&价格”页面。DeepSeek是一家中国AI公司,此次发布的是V4 Pro正式版,版本号DeepSeek-V4-Pro-0813。据官网API文档,该模型支持100万tokens上下文、最高38.4万tokens输出,总参数1.6万亿,激活参数490亿,采用MoE架构。[1] 值得注意的是,DeepSeek官方并未同步发布更新日志,正式版主要通过API灰度或正式提供服务。[2] 而就在几小时前,SpaceXAI发布了Grok 4.6,双方不约而同主打“高性能+低价格”,大模型竞争进入白热化。
DeepSeek V4 Pro正式版到底“藏”了什么大招?
核心结论是:这次升级不是简单的跑分上涨,而是让模型从“会做题”变成“会干活”。具体体现在三方面。
- 参数与上下文飙升:DeepSeek-V4-Pro-0813总参数1.6T,激活参数49B,支持100万tokens上下文和38.4万tokens最大输出。[1] 这意味着单次请求可处理数十万字材料,并能生成超长结构化内容。
- Agent能力暴涨:DeepSWE得分从预览版的12.8跃升至62.7,接近5倍增长;Terminal Bench 2.1得分87.9,逼近Anthropic Fable 5的88.0;在CyberGym(83.3分)和AutomationBench(31.8分)上甚至反超Fable 5。[2] 这些数据说明,模型开始真正理解任务拆解和工具链路,而不是只会生成代码片段。
- 双模式切换:支持思考与非思考模式一键切换。简单问答、内容摘要关掉思考模式,低延迟快速出结果;代码调试、复杂逻辑推演开启思考模式,提升推理准确率。[5] 这种设计让开发者无需为简单任务支付额外推理成本,也无需更换模型。
在专业视角看来,V4 Pro正式版最值得关注的是“DeepSWE从12.8跳到62.7”。这并非调参能实现的,而是Agent在真实工作流中开始具备独立完成整个PR(Pull Request)的能力,而不是给出一段需要反复调试的代码片段。这种从“辅助工具”到“可交付结果的协作者”的转变,才是本次更新“大招”的内核。
DeepSeek V4 Pro和Grok 4.6谁的性能更强?
如果只看综合智力,Grok 4.6更像“全能旗舰”,DeepSeek V4 Pro则更像“工程型Agent”,二者并非简单的“谁吊打谁”。据微博博主“礼哥”整理的第三方评测,Grok 4.6在Artificial Analysis Intelligence Index上拿到61分,与GPT-5.6 Sol Max持平,仅落后Fable 5一分;DeepSWE得分65.9%,高于DeepSeek V4 Pro的62.7%。[4] 而DeepSeek V4 Pro在Terminal Bench、CyberGym、AutomationBench等偏“干活”的榜单上表现更猛。需要注意的是,两者使用的Terminal Bench版本和评测框架并不完全相同,不能直接横向相减。[4]
如果把能力画像进一步拆解:Grok 4.6在GDPVal、AA-Briefcase、Harvey LAB等商业及专业任务上表现亮眼,适合知识工作;DeepSeek V4 Pro在终端操作、工具调用、安全任务和自动化执行上表现凶猛,适合工程落地。整体综合实力排序大致为:Fable 5 ≈ GPT-5.6 Sol Max ≥ Grok 4.6 > DeepSeek V4 Pro ≈ Opus 4.8。[4] 但一旦把价格和工程落地算进去,DeepSeek V4 Pro的杀伤力会明显跃升。一位开发者评价称:“真正有意思的不是DeepSeek有没有超过Grok,而是国产模型与世界最强模型的差距已经从代际差距变成能力取向差异。”[4]
价格差多少?DeepSeek V4 Pro为何被称为“价格屠夫”?
价格无疑是这轮竞争最锋利的武器。DeepSeek V4 Pro当前API价格为:缓存未命中输入3元/百万tokens,输出6元/百万tokens,缓存命中低至0.025元/百万tokens。[1] 作为对比,Grok 4.6定价为每百万tokens输入2美元、输出6美元。[2] 如果按7.2汇率折算,DeepSeek输出价格为0.83美元/百万tokens,仅为Grok的约七分之一。这种差距足以改写绝大多数To B应用的毛利模型。
实测数据更能说明问题。爱范儿在Codex环境中用同样提示词测试DeepSeek V4 Pro和GPT-5.6 Sol生成产品页:DeepSeek完成度更高、细节更好,一次生成未返工,仅花费1.3元人民币;GPT则花费2.8美元(约20元人民币)。[3] 也就是说,在同等输出质量下,DeepSeek的成本仅相当于国际顶尖模型的6%左右。对于每天调用数百万次tokens的Agent服务商来说,这几乎是“降维打击”。
开发者到底该选DeepSeek V4 Pro还是Grok 4.6?
开发者真的需要二选一吗?答案取决于使用场景。如果核心需求是深度工程执行、批量自动化处理、工具调用,那么DeepSeek V4 Pro是当前性价比最高的选择之一。它已经支持Responses API和Anthropic API,兼容性正在向国际主流对齐,并且能在Codex环境中生成比GPT-5.6 Sol更完整的代码。[3][1] 如果你更看重综合智力、知识问答、商业报告,或已经深度使用Cursor等已接入Grok 4.6的开发工具,那么Grok 4.6的体验会更加平滑。[5]
从实际工作流出发,可以按三个维度做决策:一是延迟敏感度,简单任务用DeepSeek的非思考模式秒回;二是成本敏感度,高频批量调用优先DeepSeek;三是综合智力依赖度,复杂推理、长文写作、商业分析等任务Grok 4.6略占优势。建议团队用同一组内部测试集分别跑分,重点观察代码完成度、Token消耗和失败率,再决定是否切换。
涨价风声已起,现在入手还是再等等?
DeepSeek官网已经预告:近期API服务将整体涨价,且“预计涨幅较大”。[2] 这意味着当前“能力升级但价格没动”的状态是一个短期窗口。但官方没有公布具体涨价时间和幅度。回顾DeepSeek V4系列历程:预览版4月24日上线,5月将限时优惠转为永久定价,6月底引入峰谷计费,8月13日发布正式版。[6] 价格调整是大概率事件,但“能力升级+价格不动”的窗口期不会持续太久。如果你正在规划基于Agent的自动化产品,建议在涨价前完成压力测试与成本核算;如果只是尝鲜,可以等待官方正式公告再决定。
在舆论场,微博大V“礼哥”认为“真正有意思的不是DeepSeek有没有超过Grok,而是国产模型与世界最强模型的差距已经从代际差距变成能力取向差异。”[4] “搞机工程师”则晒出V4 Pro在Codex环境中的实测效果,认为“完成度更高,细节更好”。[5] 但也有观点提醒,部分榜单的评测框架差异导致分数不能直接对比。[4] 总体上,媒体和开发者对这次更新普遍持积极态度,但官方尚未发布正式更新日志,所有评测数据仍需以官方后续声明为准。[2]
延伸来看,DeepSeek V4 Pro发布不仅是一次模型升级,也可能带动国产算力链的关注。券商分析认为,大模型产品的衡量标准正在转向“有限算力成本下产生更高效的推理与Agent执行效果”,这对国产算力、网络设备、半导体等产业链环节构成直接利好。[6] 当然,具体投资逻辑需结合市场环境,本文不构成任何投资建议。
常见问题解答
DeepSeek V4 Pro正式版相比预览版提升有多大?
据公开报道,DeepSeek-V4-Pro-0813的DeepSWE得分从12.8升至62.7,提升近5倍;Terminal Bench 2.1得分87.9,逼近Fable 5的88.0。上下文与输出窗口分别达到1M和384K。需注意,官方尚未发布正式日志,数据来自官网API文档及媒体援引的官方群评测。[1][2]
DeepSeek V4 Pro和Grok 4.6哪个更适合开发者?
DeepSeek V4 Pro在工程Agent、自动化执行和成本上占优,输入3元/百万tokens、输出6元/百万tokens;Grok 4.6综合智力更高,AA Intelligence Index 61分,DeepSWE 65.9%,更适合知识工作和复杂软件工程。如果你的预算有限且需要大规模落地,选DeepSeek;如果追求综合性能并已使用Cursor,选Grok。
DeepSeek V4 Pro马上要涨价吗?
DeepSeek官网预告“近期将大幅涨价”,但具体时间和幅度未公布。当前价格是短期窗口,建议开发者关注官方实时信息,并在涨价前完成测试与成本模型估算。
| 技术/产品 | 核心指标 | 应用场景 | 影响对象 | 限制条件 | 信息来源 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro正式版 | 总参数1.6T,激活49B,上下文1M,输出384K;DeepSWE 62.7;Terminal Bench 2.1 87.9 | 工程Agent、自动化任务、代码生成、长时间运行的智能体 | AI开发者、企业级应用、国产算力链 | 官方未发布正式日志;部分评测框架版本不同不能直接横比 | DeepSeek官网API文档[1]、新浪科技[2] |
| Grok 4.6 | AA Intelligence Index 61,DeepSWE 65.9%,输入$2/百万tokens,输出$6/百万tokens | 知识工作、商业任务、复杂软件工程、Cursor集成 | 海外开发者、知识密集型行业 | 价格高于DeepSeek;依赖国际API服务 | 博主“礼哥”整理[4]、新浪科技[2] |
#DeepSeek #V4Pro #Grok4.6 #AI大模型 #Agent #AI编程