有限次重复博弈
26-08-20 19:35 微博认证:财经博主 头条文章作者

关于 AI 是否能胜任专业数据分析工作,关键在于其处理复杂任务时的稳定性,而非偶然的正确率。

Artificial Analysis 推出的 AA-AnalystAgent 基准测试专门评估 AI 在真实财务与统计场景下的表现。该测试设定了极高的标准:执行 80 项任务,每项任务尝试 5 次,只有连续 5 次全部正确才算通过。

最新数据显示,Gemini 3.7 Flash 以 60.0% 的通过率位居榜首,Claude Opus 5 (53.8%) 和 GPT-5.5 (50.0%) 紧随其后。即便是排名第一的模型,在现实商业分析中仍有四成任务无法做通过。

AI Agent 要完全替换分析师还有一段路要走。
不过话又说回来,现在大部分分析师可能正确率有多少?感觉一点用都没有

发布于 湖南