#KimiK3#
卧槽,2.8万亿参数是个什么概念?
直白点说,这已经是妥妥的“超级巨无霸”级别,国内大模型的技术和资金门槛直接被拉到了新高度。
从技术和行业角度,简单聊聊我的几点看法:
第一,这背后是恐怖的“算力军备竞赛”。
要训练并跑通2.8万亿参数的模型,背后的算力消耗和电费都是天文数字。
这不仅是拼算法,更是在拼物理基建和资金实力。
月之暗面这次能把参数量堆到这个级别,说明其背后的算力储备和工程集群调度能力已经达到了国内最顶尖的梯队。
第二,模型架构大概率把MoE玩到了极致。
如果是传统的Dense(稠密)模型,2.8万亿的推理成本会高到无法商用。所以KimiK3几乎必然采用了极其复杂的MoE(混合专家)架构。
如何在这么庞大的体量下,精准调度不同的“专家”模块,同时把首字延迟和推理成本压下来,这极其考验工程调优的硬实力。
第三,行业竞争格局要加速洗牌了。
2.8万亿这个数字一出来,直接把通用大模型的入场券变成了“百亿俱乐部”专属。
腰部和尾部的创业公司以后很难在通用底座上跟跑了,行业会迅速向少数几家头部大厂和超级独角兽集中。
接下来的看点,就是看KimiK3在实际的长文本和复杂推理场景中,能不能真正硬刚国际一线的顶尖模型。
参数规模决定了模型的上限,虽然大不代表一切,但在这个体量下,量变大概率会再次引起质变。
这波神仙打架,最受益的还是像我们这样普通用户,我已经准备好怎么用了……[doge]
#Kimi K3参数达2.8万亿##KimiK3发布#
发布于 浙江
