唐杰THU
26-08-27 17:29 微博认证:清华大学教授,AMiner创始人 唐杰

小进展 📊
我们的 Ox Alpha(对外名字:GLM-5.3 Flash)这周在 OpenRouter 的周 token 份额冲到了近 20%,排名第一

几个数字值得一看:
· AA 57,成绩单拿得出手;
· 价格约为前沿模型的 1/100;

其实还是算力短缺,所以这次我们用了数万张国产芯片全量上线,为了保证能用,所有infra优化技术全上了。

坦率地说,国产芯片单颗的算力和显存都不算富裕,尤其是要支撑最长一百万 token 的上下文时,显存更是捉襟见肘。于是我们做了几件抠门的事:基于 SGLang 为这套架构专门打造了推理引擎,用计算换带宽、用通信换带宽,辅以节点内张量并行、ReplaySSM、W8A8 量化、混合 INT8/FP8/BF16 缓存量化等一整套组合拳。集群层面则采用 Encode–Prefill–Decode 三阶段分离架构,多模态编码、预填充、逐 token 解码各自独立调度、独立扩缩,稳定又高效。

这里有个我很喜欢的小细节:整个优化过程里,我们的Infra Agent(由 GLM-5.3 驱动)深度参与了算子开发、性能瓶颈诊断和推理栈调优,实现了模型在优化服务模型自己的系统。

相比同硬件上的初始基线,端到端服务性能提升了 3 倍,硬件效率和单 token 成本已接近主流 NVIDIA GPU。终于,国产芯片可以在规模上经济高效地支撑前沿模型的推理。价格是前沿的 1/100,效率对标主流 GPU。这个方向,我们会继续走下去。

谢谢大家的支持,下节课继续。☕

发布于 贵州