Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
最近深度研究agent挺火的,但你有没有想过——它最后给的答案不对,到底是哪一步开始跑偏的?
这篇工作就干了这么件事:收集了2790条真实的agent轨迹,把原始日志切成语义span,然后人工标注哪些span是有害错误。基于这些标注搭了个TELBench基准,还提出了DRIFT这个审计框架,专门追踪agent的声明有没有证据支撑。
实验结果是DRIFT在span级错误定位上比baseline最高提升了30个百分点。
说实话这个思路挺实用的,现在大家都在卷agent能力,但过程审计这块确实关注不够。光看结果对不对,不知道哪里出问题,调试起来跟瞎子摸象一样。
http://t.cn/AXXJkPCn
#机器学习
发布于 江苏
