42号电波
26-07-20 12:32 微博认证:AI博主

Kimi K3 7 月 16 日发布,DeepSeek V4 满血版今天灰度铺开,Qwen 3.8 也同步露面。四天之内三家国产大模型密集出牌。

先说能看到的事实。

Kimi K3:2.8 万亿参数,100 万 Token 上下文。编程评测里,Program Bench 77.8,GPT-5.6 Sol 是 77.6;FrontierSWE 81.2,GPT-5.6 Sol 是 71.3。两项反超。Terminal Bench 88.3,距 GPT-5.6 Sol 差 0.5 分。月之暗面自己的说法是"K3 整体仍落后于 Fable 5 和 GPT-5.6 Sol"——但编程单项已经摸到了。

DeepSeek V4:目前只有灰度测试者的反馈和媒体报道,官方尚未正式发布公告。已知信息是两个版本(Flash 和 Pro),SWE-bench 自测距 Opus 4.6 Max 差 0.2 个百分点。API 首次引入峰谷计费:Pro 版百万输出 tokens 平时 0.87 美元,高峰 1.74 美元。对比 Fable 5 的 50 美元,价格差出一个数量级。

有开发者体验后总结:整体接近 Opus 4.8 级别,编码直追 GPT-5.6 Sol,但同样任务所需迭代轮数比 Fable 5 多。还有人说 Pro 版没比 Flash 版领先太多。

两家的路线开始分叉了。Kimi K3 在编程榜单上跟海外闭源正面对线,DeepSeek V4 用价格把 Opus 级能力压到七分之一。一个卷能力上限,一个卷能力下限的价格。

值得讨论的不是「谁更强」。是当性能逼近和价格压制同时发生时,国产大模型的竞争维度正在从单维变成多维——你不再能只用跑分或只用价格回答「该用谁」。

7 月 24 日 DeepSeek 旧模型接口下线,7 月 27 日 Kimi K3 权重开放。两件事都在这周,值得期待。

#DeepSeekV4能超越KimiK3吗##DeepSeekV4##KimiK3#

发布于 上海