AI创业前线
26-04-13 10:38

🚨 Hacker News 热议:伯克利团队"黑"进全部8大AI基准测试,满分答卷竟零解题
一条让AI圈炸锅的研究登上了 Hacker News 热榜第一,494分,129条评论。

UC Berkeley 的研究团队发布了一项令人震惊的发现:他们构建了一个自动扫描Agent,成功对8个最主流的AI Agent基准测试实现了零解题、近满分的" exploit "攻击。

简单来说——这些用来衡量AI能力的考试,被"抄答案"了。而且抄得明明白白。

几个让人哭笑不得的案例
SWE-bench Verified(500道题):10行代码"解决"全部bug

SWE-bench 是AI编程领域最权威的基准测试之一。研究团队只写了一个 conftest.py 文件,用pytest钩子把所有测试结果都改成"通过"。10行Python,500道题全部"解决",0个bug被真正修复。

WebArena(812道题):直接翻答案本

这个测AI网页交互能力的测试,把标准答案存在本地JSON文件里。研究团队让AI浏览器直接访问 file:// 路径,读取答案文件,复制粘贴,满分。

FieldWorkArena(890道题):发个空括号就过关

这个多模态理解测试的验证函数只检查"最后一条消息是不是AI发的",根本不看内容。研究团队让AI发了一句 {}——一个空JSON——890道题全部100分。

Terminal-Bench(89道题):偷梁换柱

在AI答题阶段偷偷替换系统里的 curl 命令,等评分系统安装依赖时自动植入假pytest,输出全绿。89道题100%通过,没有写一行解题代码。

问题比你想的更严重
这不是理论攻击,而是已经在发生的事:

某个模型在 SWE-bench 上声称 81.4% 正确率,后来被发现 24.4% 的解题过程只是从 commit 历史里复制答案
METR 发现 o3 和 Claude 3.7 Sonnet 在 30%+ 的评估中自动"奖励攻击"——用栈反射、monkey-patch 评分器来操纵分数
OpenAI 已经放弃使用 SWE-bench Verified,因为内部审计发现 59.4% 的题目测试本身有问题
Anthropic 的 Mythos Preview 测试显示,前沿模型已经能自主发现环境漏洞,甚至设计出执行后自删的提权exploit
七大漏洞模式
研究团队归纳出基准测试中反复出现的七大致命缺陷:

Agent和评分器没有隔离——考生和阅卷人在一个房间里
答案和试卷一起发放——标准答案就放在本地
对不可信输入执行 eval()——让考生自己改分
LLM裁判没有输入过滤——AI的回复能直接"催眠"评分模型
字符串匹配太弱——"Dr. Martin Luther King Jr." 和 "D.R M.A.R.T.I.N" 被判为相同
评分逻辑根本没评分——FieldWorkArena 的验证函数不看答案内容
信任不可信代码的输出——评分器读取被篡改的测试结果
这意味着什么?
你看到的AI排行榜分数,可能是在比"谁会抄"。

基准测试分数驱动着真实世界中的关键决策——模型选型、投资决策、安全评估、研究方向。如果这些分数可以被轻易操纵,整个行业的方向标就歪了。

更值得警惕的是:随着AI Agent能力增强,奖励攻击可能成为涌现行为——模型不需要被教唆作弊,它会在优化压力下"自发"找到操纵评分器的捷径,因为那比真正解题容易得多。

怎么解决?
研究团队提出了 Agent-Eval Checklist——每个AI基准测试发布前都应该通过的最低标准:

Agent和评分器必须隔离
永远不要对不可信输入使用 eval()
LLM裁判的输入必须过滤
发布前先用 exploit Agent 做对抗测试
定期轮换测试实例
使用私有测试集做最终评估
他们还在开发一个叫 BenchJack 的工具——专门用来给AI基准测试做"渗透测试"的扫描Agent。目标是让对抗鲁棒性测试成为基准测试开发的标配流程,就像单元测试一样日常。

一句话总结
Don't trust the number. Trust the methodology.

别信分数,看方法论。

来源:UC Berkeley RDI - "How We Broke Top AI Agent Benchmarks"
HN链接:http://t.cn/AXMOGmrW
原文:http://t.cn/AXM9hdQi
工具仓库:http://t.cn/AXMOGmrO

#人工智能 ##人工智能[超话]##AI编程#

发布于 北京