1/n 用 LPDDR 替换 HBM——DeepSeek 4.1 Flash 架构中最重要的细节。
我曾在 2026 年 5 月预测,Engram 是许多中国实验室将采用的新的扩展方向——而我们今天在 DeepSeek 4.1 Flash 中看到了这一点。我们最近也看到了这一点——美团的 LongCat 2 和 Qwen-3.8-Flash-Next 都采用了这种架构。DeepSeek 4.1 Flash 架构中最重要的细节是,几乎一半的参数(Engram 嵌入)都驻留在主机内存(LPDDR5)上,而不是 HBM 上。这节省了:对 HBM 的需求(非常昂贵);对 FLOPs 的需求(预填充需要大量的 FLOPs)。模型的主干参数(注意力机制、MoE)仍然驻留在 HBM 上,但大多是 4 位。使用 Engram,您可以用模型主干参数的数量(需要 HBM)换取嵌入的数量(可以存储在主机内存中)。最终得到的模型性能相当甚至更好。 DeepSeek 最早在 2026 年 1 月的论文中提到了这一点:http://t.cn/AX0k6EOW
这篇文章中(2026 年 5 月)就指出,DeepSeek 将会大力采用这种方法,因为他们/华为都面临 HBM 芯片短缺的问题,而其他中国实验室也纷纷效仿 DeepSeek 的做法。所以这在意料之中。请继续阅读……
2/n Engram 嵌入可以在 GPU 上进行计算时加载(“重叠”)。请参阅 2026 年 1 月发表的原始论文,以了解具体方法。
http://t.cn/AX0k6EOO
但简而言之,获取印迹嵌入并不会浪费时间。您还可以查看
3/n 为什么 Engram 有用?简单来说,词嵌入存储了词元的含义。但许多概念需要多个词元来表示(例如“亚历山大大帝”,而不是“咖啡师亚历山大”)。Transformer 的底层工作是重构词元序列的含义。
4/n 公平地说,就权重级别而言,该模型拥有 5000 亿以上的模型主干权重和 196 亿的嵌入,其总权重与 GLM 5.3 相当。因此,必须将其与 GLM 5.3 进行比较。尽管如此,该模型仍然凭借更小的键值缓存和更强的性能脱颖而出。
http://t.cn/AX0k6EO0
