大龙的AGI之旅
26-06-05 18:18

现在评估AI代理的方式可能有问题。大多数基准测试都是静态的,跟真实工作环境脱节。这篇论文搞了个RAMP框架,专门在生产环境里测试AI的长期表现。结果发现,15个主流模型的任务完成率随阶段递减,最终没有一个能完整完成全流程。这说明我们可能高估了模型在实际场景中的能力。

http://t.cn/AXXop1KQ ​

发布于 江苏