渡势行
26-08-20 20:18 微博认证:投资内容创作者

【唐杰拆Scaling Law:万亿参数是集体弯路,GLM-5.3一颗参数没加、AA指数53→60】

智谱创始人唐杰19日在X发文系统重述Scaling Law演进,并用GLM-5.3做“控制变量实验”直接回应“为何不训新基座”的质疑——结论很锋利:当基座跨过知识承载阈值,继续堆参数边际收益递减,下一跳能力来自后训练这个旋钮。

▍Scaling Law四步修正史
2020 Kaplan:参数增速∶数据增速≈2.7∶1 → 推飞GPT-3/Gopher/MT-NLG,万亿参数成“政治正确”;
2022 Hoffmann(Chinchilla):400+模型重测,最优是每参数配~20 Token、参数与数据同速扩 → 唐杰定性“早期最大那批模型恰恰是算力分配最失衡的”;
Chinchilla后修:把推理成本塞进目标函数,最优解移向“更小模型+更久训练”(Llama-2-7B每参290 Token、Gemma-2-9B近889 Token皆属过训练);
MoE拆双轴:总参数管“记忆/长尾知识”,激活参数+有效深度管“20步因果链推理”,盲目加总参反而拖累推理。

▍GLM-5.3实验:同底座+1个月长程RL=+7分
基座不变:753B总参 / 40B激活 / 同架构同上下文;
唯一变量:增加1个月长时域环境训练+强化学习后训练;
结果:Artificial Analysis智能指数53→60(与Kimi K3持平,距Claude Opus 63差3分);Terminal-Bench 3.0 4.6→28.3,DeepSWE 46.2→66.9,CyberGym 77.2%→84.5%。
唐杰原话:“万亿参数这一轮,回头看是整个领域一起走了一段弯路,然后又一起折返。

▍对资本开支的硬含义(这比模型分数更重要)
预训练:从“70-80%算力占比”退到30-40%,头部团队预/后训练算力比逼近1∶1,中小厂放弃从零预训练、改用Qwen/Llama/DeepSeek底座微调;
后训练:RLVR(可验证奖励)、长程环境合成、 Judge Agent防reward hacking、slime级异步RL框架,成为新护城河,数据闭环>原始语料量;
推理端:生命周期成本里推理≫单次训练,Gartner预计2026起全球AI推理CAPEX首超训练、2029年推理:训练≈2∶1,算力链定价锚从“H100卖多少”转向“token成本/可靠性”;
估值重构:国产大模型资产定价权从“参数规模叙事”切到“同基座迭代增益+单任务成本(GLM-5.3 AA加权单任务$0.68 vs GPT-5.6 $1.23)”。

一句定调:唐杰这帖不是为智谱省显卡找借口,而是把行业从“排量竞赛”拉回“调校竞赛”——下一阶段AI alpha在RL环境工程、不在GPU堆头。但需注意:后训练非万能,唐杰本人留了口子“基座/预训练数据/前向算力仍会调,下一步看mid-training”,别把控制变量实验读成“预训练已死”。

风险提示:AA等第三方评测权重未完全公开;GLM-5.3权重尚未开放(预计8月底)、API成本随输出token上升;RL后训练存在reward hacking与过拟合风险;以上为技术-资本解读,不构成投资建议。

#唐杰ScalingLaw# #GLM53后训练涨7分# #万亿参数弯路# #Chinchilla修正# #AI资本开支转向推理# #RLVR护城河#

发布于 江苏