国产大模型开始调国产AI大芯片,反哺了属于是
智谱唐杰写了篇RSI 递归自我改进实践的文章,这两天 DeepSeek 算子工程师把才华埋葬在昨天的推文也火遍全网,总结两篇文章中的核心意思,可以看见正在发生一场底层算力变革:大模型化身基础设施 Agent,改写AI国产芯片的使用逻辑。
唐杰披露,GLM-5.3 驱动的 Infra Agent 仅用两周,就让 GLM-5.3-Flash 在国产加速卡从跑通到承接全量线上流量,端到端吞吐提升 3.2 倍。国产卡普遍受限于显存、互联带宽不足,算子残缺、文档匮乏。Agent 搞定 KDA 精度漂移,把 KV 传输开销从 30% 压至 1% 以内,重构 Decode 算子实现 1.71 倍加速。它依托稠密反馈机制,把顶尖工程师隐性调优经验拆成正确性、系统行为、性能三类可验证反馈,靠以算换存、通信换显存等资源置换榨干硬件潜力。Agent 每一次调优都会产生训练信号,形成 AI 递归自我改进的早期闭环。
DeepSeek 算子工程师则感慨:AI 算子能力快速追上顶尖工程师,手工写底层算子的价值持续下滑。工程师不再手写内核,转向设定约束、校验 AI 输出。
两套视角共同指向新范式:国产算力不再高度依赖稀缺算子工程师手工补软件栈,AI Infra Agent 成为自动适配引擎,大幅缩短芯片落地周期,拉高硬件利用率。
国产大模型和国产AI大芯片,双向奔赴。在国产AI大芯片上跑的大模型,反过来帮助大芯片更好使用。两者一起摆脱美制大模型+英伟达芯片的格局。#华为发布全新AI计算架构##小米大模型每小时烧钱超20万##小米直播训练大模型#
发布于 北京
