【智谱开源「牛来」多模态模型 GLM-5.3-Flash,1M 上下文跑在国产芯片集群】 #智谱开源牛来模型#
智谱昨晚把公开测试时名为 Ox-Alpha 的模型正式开源,还给它起了一个很好记的中文称呼:「牛来」。它的正式名称是 GLM-5.3-Flash,也是 GLM-5 系列首个原生多模态模型。
模型采用 320B-A18B 的 MoE 架构,将线性注意力与稀疏注意力混合。与 GLM-5.3 相比,官方称单层注意力计算量降低 3.01 倍,KV 缓存大小降低 4.44 倍。
🔍 这次还特别强调了国产算力和长上下文:
- 支持 1M 上下文窗口;
- Ox-Alpha 公开测试期间的请求全部由国产芯片集群承载;
- 团队重做推理引擎和 EPD 分离服务架构,端到端性能较初始基线提升 3 倍。
GLM-5.3-Flash 已开放 API、ZCode、智谱清言与 Hugging Face 权重,限时价格为 GLM-5.3 的 1/20。
#国产算力##开源模型#
