[CL]《How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks》Y Fei, N Liu, X Yu, S Chen… [Prentis AI] (2026)
在自主科研智能体评测领域,系统诊断其失败原因是个难题。过去的方法受困于终点式评分,本质原因是它们只看结果不看过程,无法捕捉智能体在真实科研中的具体崩溃点。
本文的核心洞见是:把智能体评测重新看作对科研全轨迹和代码日志的法证式审查。由此,“智能体法官”通过对照报告与运行痕迹,使隐藏的失败模式得以显现。
这项工作留下的遗产是揭示了智能体共同的缺陷:缺失对照证据自省、修正的“元认知回环”。它打开的新门是转向过程可靠性评估,但尚未跨过的门槛是如何构建这种能力。
arxiv.org/abs/2608.14905 #机器学习# #人工智能# #论文# #AI创造营#
发布于 北京
