TechWeb
26-08-01 14:19 微博认证:TechWeb官方微博

#DeepSeekV4Flash正式版跑分出炉# DeepSeek-V4-Flash正式版API上线。消息一出,开发者社区瞬间沸腾。

这不是一次普通的版本迭代。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.02元/百万tokens(缓存命中),却在多项Agent基准测试中,硬生生把三个月前的V4-Pro预览版摁在地上摩擦。

最大的亮点在DeepSWE(专门用于评估 AI Agent在‌真实、长周期、多步骤编程任务‌中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在 Terminal Bench 2.1(评估 AI Agent在‌Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力‌的权威基准测试) 中,Flash 正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0。

在海外模型评测机构Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型的中位数仅为17分。

最让人细思极恐的是模型结构、尺寸一点没变,只是重新做了一遍后训练。

这意味着什么?后训练优化的空间,可能比我们想象的大得多。
http://t.cn/AXCxxL7J