蚁工厂
26-08-27 08:13 微博认证:科技博主

Sebastian Raschka绘制的GLM-5.3-Flash架构图
越来越复杂了。
----
相比 GLM-5.2,这个新的 GLM-5.3-Flash 模型采用了:
1️⃣一种类似 Kimi Linear 的 3:1“超级混合”注意力模式:包含 34 层 Kimi Delta Attention(KDA),以及 11 层 Multi-head Latent Attention(MLA,多头潜在注意力)/ DeepSeek Sparse Attention(DSA,DeepSeek 稀疏注意力);
2️⃣一个按 GLM-5.2 风格缩小后的稀疏 MoE 主干网络:从 744B-A40B 缩减到 320B-A18B;
3️⃣一条类似 DeepSeek V4 的 mHC 残差路径,包含 4 条并行信息流;
另外还有一个原生视觉编码器(图中未展示)。

*之所以称为“超级混合”,是因为 KDA 和 MLA/DSA 本身都属于“高效型”组件。比如,Kimi 使用的是 KDA + 全注意力 GQA;DeepSeek V3.2 使用的是 DSA + 全注意力 MLA。
#智谱发布GLM5.3Flash#

发布于 山东