8月13日,DeepSeek V4 Pro正式版API上线:缓存未命中输入3元/百万Token、输出6元/百万Token,为V4 Flash的3倍;但价格仅为海外旗舰的约1/23至1/34,DeepSWE评分从预览版12.8飙升至62.7,逼近第一梯队。对于需要复杂Agent任务的团队,这是当前性价比最高的旗舰选择之一。

  据每日经济新闻[1]报道,8月12日晚,DeepSeek开放平台已将模型版本从preview切换为DeepSeek-V4-Pro-0813,调用名保持不变,老接口直接升级。官方定价页显示,V4 Pro按每百万Token计费:缓存命中输入0.025元,缓存未命中输入3元,输出6元。相比之下,V4 Flash分别为0.02元、1元和2元。

  值得注意的是,8月6日DeepSeek曾公告“API服务近期将大幅涨价”,一度引发市场担忧[2]。但正式版落地后,基础价格非但没有上涨,反而将预览期2.5折优惠永久化——据澎湃新闻[3]报道,官方表示将把折扣永久化,正式版定价仅为V3.2旗舰的1/4,即降价75%。所谓“涨价”,仅指工作日高峰时段(北京时间9:00-12:00、14:00-18:00)的峰谷定价机制。这一反差,让不少开发者“虚惊一场”。

  DeepSeek V4 Pro API定价比V4 Flash贵多少?

  结论:V4 Pro基础价格正好是V4 Flash的3倍;高峰时段输出价更是达到Flash基础价的6倍。

  从官方定价看,V4 Pro与V4 Flash的价差非常清晰:

产品/型号DeepSeek V4 ProDeepSeek V4 Flash
价格/定位输入3元/百万Token,输出6元;旗舰级Agent与推理输入1元/百万Token,输出2元;高吞吐轻量级
核心配置混合注意力架构(CSA+HCA),100万Token上下文,并发上限5002840亿总参数,100万Token上下文,并发上限2500
优势DeepSWE 62.7,接近顶级模型;工具调用能力强价格便宜3倍,吞吐量高5倍,支持Responses API并接入Codex
短板高峰时段价格翻倍,并发较低复杂推理能力弱于Pro
适合谁复杂Agent、高难度代码生成、深度研究大规模批量处理、轻量对话、成本敏感型应用
注意点需要关注峰谷价格,建议缓存命中缓存命中后价格极低,但功能场景有限

  缓存命中输入价格仅为0.025元,与未命中价格相差120倍。这意味着,如果开发者能够将常用提示词、工具定义和知识库片段缓存,单次调用的边际成本几乎可以忽略。DeepSeek官方在文档中建议,对于频繁调用的场景,应优先设计缓存友好的上下文结构。

  据动机资本[4]整理,在高峰时段,V4 Pro输出价格从6元涨至12元/百万Token,V4 Flash从2元涨至4元。这意味着,如果你在上午10点调用V4 Pro,输出成本是使用Flash基础价的6倍(12元 vs 2元)。因此,峰谷定价对成本影响极大,建议开发者合理安排任务时段。

  从并发上限看,V4 Pro为500,V4 Flash为2500,后者是前者的5倍。这源于两者定位的不同:Pro聚焦高难度推理与复杂Agent任务,Flash则更看重高吞吐量轻量场景。

  性能暴涨近5倍,V4 Pro凭什么贵3倍?

  结论:DeepSWE评分从12.8升至62.7,涨幅约390%(近4.9倍);多项基准测试紧逼海外旗舰,贵得有理。

  正式版最大的惊喜来自性能跃升。在软件工程基准DeepSWE上,V4 Pro从预览版的12.8分飙升至62.7分,涨幅接近4倍。在TerminalBench上拿到87.9分,HLE(带工具)60.0分,NL2Repo 61.5分,均与Fable 5、Opus 4.8等海外旗舰差距极小[4]

  这些分数对开发者意味着什么?DeepSWE模拟真实软件工程任务,要求模型理解代码库、定位问题并生成补丁,12.8到62.7的跨越意味着V4 Pro从“偶尔能帮上忙”进化到“可以胜任初级工程师的多数工作”。TerminalBench 87.9分则表明它在终端命令执行、工具调用链上已经非常可靠,这正是复杂Agent最核心的能力。

  值得一提的是,预览版V4 Pro在5月的DeepSWE评分仅为12.8,当时被不少开发者吐槽“代码能力配不上旗舰定位”。而正式版在短短三个月内将分数提升至62.7,表明团队在模型对齐和工具调用上做了大量优化。

  性能提升的背后是架构创新。V4 Pro采用混合注意力架构(CSA+HCA),在处理百万Token级上下文时,推理计算量降至V3.2的27%,KV缓存占用仅10%。这意味着更低的成本和更高的效率,也为低价策略提供了技术支撑。

  涨价预告为何变成“真香”低价?DeepSeek在下一盘什么棋?

  结论:所谓“大幅涨价”其实是峰谷定价机制,基础价反而因永久折扣降至原价1/4。

  8月6日,DeepSeek公告“API服务近期将大幅涨价”,市场普遍预期V4 Pro正式版会借机提价。但结果恰恰相反:正式版基础定价与预览版2.5折优惠后的价格一致,官方还宣布将折扣永久化[3]。事实上,如果按照原价计算,V4 Pro正式版比V3.2旗舰还低75%——这是一次彻头彻尾的“反向涨价”。

  回顾价格调整时间线:4月24日,DeepSeek V4 Pro和V4 Flash正式发布并开源,上下文长度从128K扩展至1M;4月26日,官方推出V4 Pro API 2.5折特惠;5月22日,官方宣布优惠结束后将永久降价至原价的1/4;5月31日,该折扣正式转正。因此,所谓“大幅涨价”的公告实际上是在已确定的永久低价基础上,叠加了一个峰谷浮动机制。

  业内分析认为,DeepSeek此举是典型的“预期管理”:先用涨价预告试探市场反应,再用低价转正制造“真香”效果,同时为高峰时段动态调价铺路。在算力成本持续攀升的背景下,大模型行业正从低价抢用户转向寻求可持续商业化[5]。高峰时段翻倍可以平抑算力需求,而基础价永久低价则继续拉高市场占有率。

  事实上,V4 Flash正式版上线后,OpenRouter平台周度调用量达7.22万亿Token,位居全球第一,8月4日甚至因访问量过大出现容量不足。算力压力可见一斑。峰谷定价正是为了引导开发者错峰使用,优化资源分配。

  舆论场上,开发者的看法并不一致。有开发者在社交媒体上调侃“DeepSeek把涨价预告做成了促销广告”;也有人担忧峰谷定价会推高企业级应用在高峰期的成本。这些属于个人观点,尚无权威数据证实其影响,需以官方实时信息为准。目前,DeepSeek官方尚未对“低价是否可持续”等追问作出进一步回应。

  V4 Pro和V4 Flash怎么选?适合哪些人?

  结论:无脑选V4 Pro?并非如此。对于高吞吐量、成本敏感的任务,V4 Flash仍是更优解;但若你的应用涉及复杂Agent、深度代码理解和多步推理,V4 Pro的性能优势会带来更高任务成功率。

  选择建议:

  • V4 Pro适合:开发复杂AI Agent、自动化编程工具、深度研究助手等,尤其是需要调用工具完成多步任务的场景。其DeepSWE 62.7分意味着能解决更真实的软件工程问题,减少人工兜底。
  • V4 Flash适合:大规模数据清洗、文本分类、实时客服、内容摘要等“量大面广”的任务。2500并发上限和1元/百万Token的输入价格,能让总成本压到最低。

  用一个具体场景来模拟成本:假设你的应用每天调用1000万Token输入、200万Token输出,全部使用V4 Pro,按非高峰时段计算,成本为1000万/100万×3 + 200万/100万×6 = 30+12=42元。如果同样工作量使用V4 Flash,则为10+4=14元。但若任务复杂性高,Flash可能需要多次调用或人工修正,综合成本未必更低。

  需要强调的是,V4 Flash是当前唯一支持Responses API并可接入Codex的V4模型[2]。如果你的应用依赖Codex生态,即便Pro性能更强,Flash也是现阶段唯一选择。

  大模型API定价趋势与开发者决策建议

  结论:行业正从“价格战”转向“价值战”,峰谷定价或成标配;开发者应学会利用缓存和时段优化成本。

  从V4 Pro的定价策略可以看出,头部大模型厂商正在探索更精细化的商业化路径。一方面,用永久低价守住开发者基本盘;另一方面,用高峰时段动态调价平衡算力峰值压力。类似做法在云服务领域早已成熟(如AWS的Spot实例),但在大模型API领域仍属新尝试。

  对开发者而言,建议从三个维度考虑成本:

  • 缓存:尽量利用缓存命中(0.025元 vs 3元,差距120倍),将可复用的上下文(如系统提示词、工具定义)提前缓存;
  • 时段:非紧急任务错开高峰,可节省50%成本;
  • 模型:将任务按复杂度分级,简单任务交给Flash,复杂任务交给Pro,避免“大炮打蚊子”。

  此外,关注后续版本更新。V4 Pro正式版的调用名DeepSeek-V4-Pro-0813已固定,但DeepSeek是否会推出更高规格的“Ultra”或“Max”版本,尚无官方信息。开发者可留意官方公告。

  常见问题解答

  DeepSeek V4 Pro API是免费的吗?

  不是。V4 Pro正式版按量付费,缓存未命中输入3元/百万Token,输出6元/百万Token;不过官方已将原2.5折优惠永久化,该价格即为永久价格。相比海外旗舰Fable 5的10美元/30美元,V4 Pro要便宜得多。

  DeepSeek V4 Pro和V4 Flash哪个更好用?

  取决于场景:V4 Pro在复杂推理、代码生成等任务上明显更强,DeepSWE评分62.7;V4 Flash胜在便宜、吞吐量大,并发上限2500,且目前支持Responses API和Codex接入。如果你的任务是批量轻量处理,Flash性价比更高。

  高峰时段到底多收费多少?

  工作日9:00-12:00、14:00-18:00为高峰时段,价格是平日的2倍。以V4 Pro输出为例,将升至12元/百万Token。建议对时间不敏感的任务错峰调用,或使用缓存命中(高峰时段缓存命中输入0.05元)降低成本。

  #DeepSeek V4 Pro# #API定价# #大模型商业化# #Agent开发#