前沿在线
26-08-20 17:15 微博认证:前沿在线微博官方账号

智谱唐杰:大模型只看参数的时代结束了,Scaling 有很多旋钮

智谱创始人唐杰最近在 X 发了篇 Scaling Law 长文,核心观点就一句话:大模型只看参数的时代结束了。

GLM-5.3 刚验证这点:参数没动,靠后训练把 Terminal-Bench 从 4.6 干到 28.3,DeepSWE 从 46.2 涨到 66.9。

唐杰认为,单独报参数量已难说明模型水平,至少还得看数据量、算力分配、运行条件三件事。

2020 年 Kaplan 定方向:预算增加时参数应比数据增长更快,约 2.7 比 1。全行业开始卷参数,万亿成标配。

两年后 DeepMind 发现参数太多数据太少。Chinchilla 用 700 亿参数配 1.4 万亿 Token,同计算量下碾压 2800 亿 Gopher。最优配比改成约 20 Token 对应一参数。

但 Chinchilla 也不是终点。它解决训练阶段分配,可模型训完还要被调用无数次,推理成本也是钱。预计处理 10 亿次请求时,更小模型配更长训练,全生命周期成本可能更低。训练强度提到每参数 1 万 Token,质量还涨。

到 MoE 时代,参数拆成两个维度:总参数像仓库决定能装多少知识,激活参数和有效深度更像一次能调动多少能力、推理链能走多远。

这解释 GLM-5.3 的打法:保留 GLM-5.2 基座架构,参数不变,过去一个月把新增计算全砸在长程任务和强化学习上。

唐杰结论是:Scaling 有很多旋钮,参数规模、预训练数据、单次前向计算量、后训练强度都是。多个旋钮不用同时转,上轮最值得投入的方向,下轮可能已让位新瓶颈。

以前发布会标题必写参数多少万亿。现在呢?Qwen3.8-27B 靠 27B 干翻 Opus,GLM-5.3 不动参数靠后训练暴涨,Nemotron 3.5 Lightning 用 30B MoE 做 Agent 层,参数规模只是维度。

竞赛单位正在变,从 "谁的知识库更大" 转向 "谁能让模型在真实环境把复杂任务做完"。如果它要像数字员工那样连续工作几小时几天接手完整项目,决定胜负的就不只是记住多少,而是能不能不掉线、不跑偏、对结果负责。

万亿参数没消失,只是从现在开始,它可能不再是唯一值得写进标题的数字了。
#前沿在线#

发布于 江西