李楠或kkk
26-08-19 12:54 微博认证:Angry Miao创始人 财经观察官

所以可能存在一个 最优模型规模 x 最优 token 消耗倍数的交集。

在这个交集下 output 最优(考虑预算限制)。

从目前的模型性能表现上看,而这个最优规模可能是几百 B 而非数 T ,token 消耗倍数大概是 5 而非 10 或者 100 。。。

即在固定预算下,存在一个“模型规模 × test-time 计算(抽样次数/树搜索扩展/生成 token 上限)”的帕累托最优交集。

SOTA 的追求意义可能不大了。

发布于 广东