全球首个3万亿开源模型:Kimi K3在长程编程上反超Fable 5,但价格也贵了80倍
7月16日深夜,月之暗面发布Kimi K3——2.8万亿参数,全球首个开源3T级别模型。100万token上下文、原生视觉理解,即日起在kimi.com和官方App可用,完整权重7月27日前开源。选在WAIC开幕前一天发,卡位意图很明显。
先说跑分里最值得拆的一项。SWE Marathon是专门测多文件、多小时长程编程的基准,最接近真实工程师一天的工作状态。K3拿了42.0分,反超Claude Fable 5(35.0)和GPT-5.6 Sol(39.0),全球第一。Frontend Code Arena前端代码竞技场同样登顶,1679分压过Fable 5的1631分,7个细分领域6个第一。BrowseComp网页浏览检索91.2分也是第一。但月之暗面自己说得很坦白:综合智能指数57分(Artificial Analysis),整体仍排第三,落后Fable 5和GPT-5.6 Sol。不是每个单项都赢,但赢的那几个恰好是离实际生产最近的。
架构层面有两个真正有意思的东西。第一是KDA(Kimi Delta Attention),自研的混合线性注意力机制——核心解决的问题是"100万token的上下文不是摆设,而是你真用得起"。第二是AttnRes(注意力残差),让信息在模型深层之间跨层检索而非逐层堆积,训练效率提升约25%,代价不到2%额外算力。MoE层面896个专家只激活16个,极端稀疏比配上Stable LatentMoE框架和Quantile Balancing路由,整体扩展效率比K2提升2.5倍。翻译成大白话:参数翻倍了,但每个token花的算力没有等比膨胀。
最能说明问题的是官方甩出的三个案例,都不是跑分题,是干真活。第一,K3从零手搓了一个叫MiniTriton的GPU编译器——自带tile级IR层、优化pass和PTX代码生成流水线,跑分在某些负载上比Triton还快,还能撑nanoGPT端到端训练。第二,连续48小时自主运行,用开源EDA工具和Nangate 45nm工艺库,独立设计并验证了一颗4mm²的芯片,100MHz时序收敛,解码吞吐8700 tokens/s。第三,用20多个并发子代理分析了391个引力波事件,产出7张可视化图和10篇论文综述。不是"能回答问题"的模型,是"能干活"的模型。
但价格是个必须说清楚的事。K3国内定价:缓存命中输入2元/百万token、未命中20元、输出100元。对比DeepSeek V4 Pro的0.025元、3元、6元——输入端贵了80倍,输出端贵了近17倍。月之暗面把K3定位为"前沿智能"而非"性价比之选",和DeepSeek走的是完全不同的市场路线。 ARR突破3亿美元、估值315亿美元(年内第6轮融资),资本市场投的是"前沿"这张牌,不是"便宜"。
也有诚实的局限标注。K3在保留思考历史模式下训练,若代理框架没按要求传回全部历史思考内容,生成质量可能极不稳定;遇到小问题或用户意图模糊时可能替用户做意外决策。官方建议在系统提示里施加明确行为约束。
过去12个月里有9个月,Kimi模型保持着开源模型的规模上限。从K2的1T到K3的2.8T,参数翻了近3倍,但真正值得标记的不是数字本身——是每代2.5倍的扩展效率提升,意味着下一代追上Fable 5可能不需要6万亿参数。开源和闭源的差距,已经从鸿沟变成了裂缝。
