东哥爱抓板
26-08-27 01:10 微博认证:娱乐博主 微博原创视频博主

重磅!智谱一句话炸穿全场:GLM-5.3 Flash推理全切国产卡,供应商华为海光摩尔线程?
8月26日,智谱发布GLM-5.3 Flash——320B总参/18B激活MoE,原生多模态,AA智能指数57分持平Claude Opus 4.8,定价仅GLM-5.3的1/10!但最炸的不是模型本身,是官方那句:推理服务跑在超过10万张国产芯片集群上,供应商或来自华为昇腾、摩尔线程、海光。
过去,行业里国产卡适配大模型多是截图式Demo!智谱这次是真把生产流量切上去了——自研高带宽互联+SGLang改专用推理引擎+EPD分离架构,端到端吞吐较同硬件基线提升3倍,单Token成本追平主流英伟达GPU。模型侧也配合到位:稀疏+线性注意力混合,KV Cache压到GLM-5.3的1/4.44,1M上下文能跑;价格输入0.8元/百万Token、输出2.8元,比DS V4 Flash谷时还低,前两周再半价。
智谱不是适配了国产卡,而是把10万张昇腾/海光/摩尔线程塞进生产级推理集群,用320B模型真刀真枪接用户调用——国产算力从能跑到敢扛生产的拐点,被GLM-5.3 Flash踩实了。

发布于 浙江