模型榜上的小数点,常常没那么客观。
Hugging Face 在2026年6月30日公布了一个很扎眼的例子:同一个 LLaMA 65B、同一个 MMLU 基准,公开结果里既出现过63.7分,也出现过48.8分。两者足足差了14.9分。
为什么会这样?模型评测没有一台统一的标准秤。谁来跑、通过什么方式访问模型、提示和采样参数怎么设、指标怎么算,都会改变最后那个数字。
小数点很精确,过程未必透明。
EvalEval Coalition 做的 Every Eval Ever,正是在补这块信息。它用统一格式记录运行者、模型、访问方式、生成设置和指标含义,还建议附上逐样本输出。Hugging Face 的 Community Evals 则让这些结果能回到模型页面,并保留来源线索。
第一,谁跑的,是模型方、第三方还是社区?第二,跑的是哪个模型与数据版本,通过什么接口?第三,提示、示例数量和生成参数是什么?第四,分数对应的指标到底在测什么?第五,有没有完整日志或逐样本输出,别人能不能复现?
这5问看起来麻烦,其实像看体检报告。只看一个「总分正常」,却不知道空腹没有、机器型号和参考区间,数字再整齐也没法下判断(模型榜也是一样)。
我的简单标准是:关键设置缺两项以上,就先把它当弱证据;如果两款模型只差一点,却来自不同运行方和不同配置,不要急着宣布谁赢了。先找同一套测试条件,再看差异是否稳定。
买模型服务时也一样。假设甲在榜上高两分,但没有公开提示和逐题输出;乙分数略低,却能看到失败样本和复现实验。我会先把乙放进自己的真实任务里测。低分本身没有优势,可追溯才给了你判断误差来源的机会。
还有一问经常被漏掉:测试数据有没有被模型见过?这件事有时很难彻底证明,所以更需要把基准分和真实任务结果分开记,别让一张榜替你做完所有选择。
统一基准仍然是筛选候选的重要入口。它回答「在这套条件下表现怎样」,放进真实工作后的成本、速度和稳定性还要另测。
我宁可信一个别人能照着再跑的分数。
#马力的AI知识分享#
