10万颗国产卡,两周,一个开始优化自己的模型
① 两周跑完一次大规模国产化部署。GLM-5.3-Flash 此次部署运行在超过10万颗国产AI加速器组成的集群上,智谱称这是一次"缺少成熟经验参考"的大规模部署:显存容量和互联带宽双重受限、新架构适配、100万token长上下文、多模态请求,外加国产卡软件生态仍在发育——部分Kernel支持不足,很多资料得工程团队自己摸索。最终结果:端到端服务性能较初始版本提升约3倍,硬件利用率和单token成本接近主流NVIDIA GPU平台。
② 真正的变化不是AI写代码,而是AI看懂系统为什么慢。系统只报"吞吐下降20%",但不会告诉你是哪一层、当前假设错没错、下一步验证什么。智谱把这个工程判断过程封装成可调用的反馈机制,叫 dense feedback:须贴近具体问题、能快速获得、能用客观实验验证——否则海量日志反而让Agent迷失方向。
③ Agent交出的三个实绩:
KV Transfer:发现未与DeepEP Dispatch有效重叠,沿Python/C++调用链定位到节点内路径未及时释放GIL,额外开销从超30%降到1%以下;
Decode Kernel:发现因切分方式导致同一组归一化计算被重复执行四次,重构后性能提升1.71倍;
长上下文精度:在KDA上下文并行路径中定位TF32舍入误差随序列长度累积导致的状态传播偏差,修复已合入 Flash Linear Attention PR #1180。
④ 方法论比结果更值钱。Agent从SGLang、Flash Linear Attention、DeepGEMM等开源项目中提炼出"optimization skeleton",再结合当前系统反馈判断是否适用——过去这类经验只沉淀在资深工程师个人身上,现在变成可迁移、可验证的流程。
⑤ 工程侧解法清单:ReplaySSM以计算换内存、节点内张量并行降显存压力、INT8/FP8/BF16混合精度缓存提容量利用率、EPD(Encode-Prefill-Decode)分离式架构让各推理阶段灵活调度。核心不是堆算力,而是在算力、内存、通信、调度之间重新找平衡。
⑥ 真金白银的市场验证:部署后GLM-5.3-Flash以匿名名 Ox-Alpha 上线 OpenCode 与 OpenRouter,一周内成为两平台使用量最高的模型之一,六天处理超62万亿token。
⑦ 边界要说清:唐杰明确表示,距真正意义上的递归自我改进(RSI)仍然很远,人类工程师仍负责设定目标、搭建反馈环境、审核高风险修改。但工程师角色已在迁移——从"直接解决每个问题的人"变成"设计反馈系统的人"。模型优化系统,系统服务模型,一个最小规模的循环已经出现。
一句话:这不是AGI的终点,而是AI第一次成规模地参与优化承载自身运行的基础设施——国产算力缺的从来不只是卡,还有把卡用明白的工程经验,现在这部分经验开始能被模型自己学习和复制。
