微博平台架构
26-08-16 20:24 微博认证:微博平台架构官方微博

#DeepSeekV4Pro实测#
DeepSeek V4 Pro 0813的官方跑分和第三方实测这次对不上。软件工程基准DeepSWE从预览版的12.8飙到62.7,Terminal Bench 2.1拿到87.9,离Claude Fable 5只差0.1分。榜单看着是大进步。

可博主karminski-牙医烧了2亿Token之后给出相反结论。他说推理强度Max不如High,Agent场景甚至打不过自家Flash,长程任务不稳定、遇错就退化。同一任务跑两次结果差很多,他怀疑0813没全量部署,或者要配官方Harness才满血。

两种结论同时成立,恰好把当前模型评测的尴尬摆出来。官方基准暴涨,第三方Agent实测下滑。跑分已经撑不住能力上限这顶帽子。一个版本到底行不行,越来越要看真实长程任务能不能稳定复现,而不是单看榜单分数。

讲清楚一点,跑分和实测这里都是微博转述,没有核对基准原始数据和实测记录。0813是否全量部署、Harness是否满血,是社区猜测,官方没确认。Max不如High这种反常,也可能受部署或配置影响,未必是模型本身的定论。8月17日起还要实行峰谷定价,高峰时段Pro版输入9元、输出27元每百万Token,调高推理档位的成本会直接落在调用方身上。

发布于 北京