【当测评变成玄学:AI大厂真的在为“鹈鹕骑自行车”刷榜吗?】程序员 Simon Willison 那个“让 AI 画个鹈鹕骑自行车的 SVG”已成业界知名的非官方 benchmark。博主 Dylan Castillo 为此生成了 1000 多张 SVG,横跨 8 种动物和 6 种交通工具。结果显示,模型画鹈鹕和自行车的得分甚至在平均线以下,并无统计学证据表明实验室在针对这个特定 Prompt 偷偷加练。这反映了 AI 行业在面对 Goodhart 定律时的微妙处境:当一个非正式指标变得太有名,大家就开始怀疑它被过度优化。实际上,大厂更可能在搞高级的 SVGmaxxing,即整体提升模型利用代码构建空间结构的能力。至于为什么鹈鹕全都朝右骑,未必是背答案,更可能是因为自行车传动系统就在右侧,训练数据自带这种物理偏置。与其担心大厂在针对性“背题”,不如关注他们如何通过卷 SVG 生成来弥补 Transformer 在空间理解上的天然短板。 dylancastillo.co/posts/pelicanmaxxing.html
发布于 北京
