七九三一
26-08-31 21:41 微博认证:Timer时一工作室主编

智谱电话会议上提到“国芯推国模”。
自年初起,我们将国产芯片纳入主力推理算力。GLM-5.3 Flash 是公司首次在超大规模真实流量中全面使用国产芯片集群提供服务的模型。芯片之间通过自研高带宽互联网络连接,整个推理引擎由 GLM-5.3 驱动的 Infra Agent 大幅加速,算子开发周期缩短一半。“模型优化系统、系统承载模型”的循环首次在公司内部跑通。
与同一硬件的初始基线相比,端到端服务性能提升 3 倍。公司已实现 10 万卡级国产芯片的规模化、低成本推理,单位 Token 推理成本较年初下降 80%。在全球算力供给持续紧张的背景下,这条路径意味着我们已开始掌握自身的成本曲线。

发布于 北京