i歌者
26-07-20 02:04

#赛博茶馆[超话]#Kimi K3登顶Arena,价格涨到美国档,然后暂停了新用户订阅——这三件事放在一起看,比单独任何一件都值得聊。

先说事实。7月16日,月之暗面发布Kimi K3:2.8万亿参数,100万token上下文,原生多模态,目前全球参数最大的开源模型。上线不到一天,Arena前端代码竞技场1679分直接登顶,压过Claude Fable 5(1631分)和GPT-5.6 Sol(1618分)。上一代K2.6在这张榜上排第18。一代产品,跳了17个位次。

然后是价格。每百万token,缓存未命中输入3美元,输出15美元——和Anthropic Sonnet 5完全一样。Simon Willison说这是中国AI实验室迄今发布的最贵模型。一年前没人会跟一个中国模型认真讨论"值不值这个价",现在大家吵得不可开交。

紧接着,7月19日,月之暗面宣布暂停C端新用户订阅,理由是算力紧缺,已有算力全部投入服务已有用户。同一天,财联社报道月之暗面已向投资人发送上市议案,预计最快六个月内港股IPO。

这三件事串起来,讲的是一个故事:中国AI第一次同时在性能、定价和商业节奏上,跟美国前沿模型坐在了同一张桌子上。

但桌子下面的裂缝也很明显。

第一,"登顶"有前提。Arena官方标注这是"初步"成绩,投票数未达稳定阈值。月之暗面自己也在发布博客里写了一句大多数厂商绝不会写的话:"整体性能仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol。"伯克利教授Ion Stoica的判断是差距缩短到2-3个月,但那是"缩短",不是"消失"。

第二,便宜不再,但也不一定贵。Cline的实测很有意思:让K3和Fable 5修复同一个真实bug,K3花了0.92美元(120万token,34次工具调用,12分钟),Fable花了2.13美元(73万token,18次工具调用,3.5分钟)。K3的任务总成本更低,但用了更多轮次、更长时间。这说明K3的经济学模型跟美国模型不一样——不是"便宜替代品",而是"更便宜地完成同一件事,代价是更慢"。

第三,幻觉率同步上升。Artificial Analysis的数据:K3答题准确率从33%涨到46%,幻觉率却从39%涨到51%。它变得更敢答了——知道的答得更多,不知道的也更倾向于硬写,而不是承认不知道。这在编程任务里可能是优势(多试几次总能跑通),在需要精确判断的场景里就是隐患。

第四,一个有趣的细节:K3研发后期,大部分GPU内核优化工作是由一个早期版本的K3自己完成的。2.8万亿参数的模型,参与了制造它自己。这在行业里不是首创,但在这种体量上"自举",还是第一次。

回到暂停订阅这件事。算力紧缺是真的——2.8万亿参数的MoE模型,896个专家激活16个,推理成本摆在那里。但暂停订阅的时机也很微妙:模型刚登顶、IPO在即、WAIC正在上海开。这不是一个被迫的决定,更像一个主动的选择——在算力有限的情况下,优先保用户体验,而不是冲用户规模。

这让我想到一个更大的问题:中国AI公司的竞争维度正在发生根本性转变。过去两年,竞争的核心是"谁能用更少的钱训出更好的模型"。现在,当K3的价格和Sonnet 5一样、性能在某些维度超越、某些维度落后的时候,竞争变成了"谁能把模型能力转化成可持续的商业价值"。

DeepSeek选择了开源低价路线,月之暗面选择了闭源高价路线。两条路都有道理,但不可能同时走。

你觉得中国AI模型应该继续打价格战,还是像Kimi K3这样开始收"美国价"?价格涨上去了,用户会买单吗?

#KimiK3# #月之暗面# #AI大模型# #Arena# #赛博茶馆#

发布于 北京