唐杰THU
26-09-17 17:05 微博认证:清华大学教授,AMiner创始人 唐杰

AI的下一站,是AI自我进化、自己创造自己的继任者。这被称为RSI,递归自我改进。

最近在GLM的研发过程中,我们已经看到了这种能力的早期迹象:GLM-5.3开始帮助优化GLM-5.3-Flash在国产芯片上的部署。

一个由GLM-5.3驱动的Infra Agent,用两周时间,帮助GLM-5.3-Flash在国产加速卡上第一次跑通,到承载全部线上流量,端到端吞吐提升至3.2倍。

困难超级的多。国产芯片显存和互联带宽受限,要支持1M上下文和多模态请求,生态不成熟,算子不完备,很多文档基本靠猜。

GLM-5.3驱动的Infra Agent解决了三个关键问题:修复KDA精度漂移,将KV传输开销从30%以上降至1%以内,并通过重构Decode算子获得1.71倍加速。

每一项优化,本质上都是一次资源置换:以算换存、以通信换显存、以精度换容量、以分离换调度自由。

牛的人类工程师可能脑子里有一套隐性经验:什么时候看时间线,什么时候跑微基准,该对比哪一层的输出。

现在大模型里面我们需要把这套经验显式化,把分层验证接口做成Agent可以直接调用的工具,称之为稠密反馈。
正确性反馈:算对了吗?
系统行为反馈:时间花在哪里?
性能反馈:哪个方案在什么条件下更好?

每一类反馈都必须足够局部、足够廉价、可以客观验证。反馈系统一旦建立,真实任务就会源源不断地产生训练信号。

换句话说,Agent完成的每一个任务,都是它的继任者的训练场。

We are still far from recursive self-improvement.
But the smallest loop now exists.
The model optimizes the system. The system serves the model.

blog链接:http://t.cn/AXOaing7

发布于 上海