AI产品阿颖
26-02-14 18:06 微博认证:科技博主

最近最重要的一篇 AI 技术报告,并非出自谷歌。

昨天,啃了一天面壁的最新技术报告。

这个技术报告,强烈建议做 AI 的同学都花时间看看。

注意力机制是 Transformer 的核心,决定了模型的上下文长度。这篇技术报告,详细分享了面壁在这件事的思考,还有他们的最新探索。

与之对应的,面壁还发了一款全新的小模型,叫 MiniCPM-SALA。小模型目前确实没有那么出圈,没有 GLM、Minimax、DeepSeek、字节那种声量。

但小模型本身很重要,只是大家还没意识到,得一阵一阵来。

而且面壁这家公司的气质非常像 DeepSeek,在资源受限的情况下,不停死磕底层的技术创新。小模型嘛,本身就意味着资源永远是受限的。

这次 MiniCPM-SALA 之所以重要,是因为他们是行业首个大规模训练的稀疏-线性注意力混合架构模型。

基于新的注意力机制,这次模型可以在消费级 GPU 上,跑通 100 万 token 的长文本推理,而且 KV Cache 不到 6GB。以前这个场景根本跑不了。

我写写我的理解。有不对的地方欢迎大家指正。http://t.cn/AXtcoQNz

发布于 北京