平凡ZhiH
26-07-17 04:01 微博认证:微博新知博主 科技博主

多模态模型能把一张图讲得头头是道,和它有没有稳定看清,是两回事。

Moonshot AI 刚发布 PerceptionBench,题型来自40多个现有基准中的真实失败,团队一路追到最早出错的视觉步骤,再归成10类原子感知能力和3000道已验证题。官方测了16个模型,没有一个超过60%准确率,最高的GPT-5.6-Sol是59.7%,Kimi-K3是58.5%。

还有一组结果更扎眼:不少第一次答对的问题,重复问一次就复现不了。一次答对,可能真的只是猜中了。

所以在文档识别、图表分析和界面操作里,拿一张样图测通还远远不够。更稳妥的做法,是把自己的关键图片按计数、OCR、定位和幻觉拆开,同一题重复几轮,再决定哪些步骤可以交给Agent自动执行。看错一次如果会触发后续操作,整体榜单再好看,也不能替流程兜底。

发布于 英国