AI猩猩幼儿园
26-07-28 06:25

16个顶级AI看图,没一个及格

Kimi 团队最近放了个狠活,搞了个叫 PerceptionBench 的测试集,专门考多模态大模型的视觉感知能力

💡 思路特别有意思,他们没有预先定义「AI应该能看到什么」,直接从真实的模型错误里反推。跑了 42 个现有 benchmark,把模型翻车的地方拆解归因,最终提炼出 10 个原子级视觉感知维度

视觉关系、计数、属性识别、深度与3D、定位、比较、细粒度识别、上下文整合、OCR,还有幻觉

📊 一共 3000 道验证过的题目,每道只考一个维度,而且设计得很绝,纯靠「看」就能答,不需要推理,不需要外部知识

然后让 16 个前沿多模态模型来做

结果。。。没有一个模型准确率超过 60%
|🥇|第一名 GPT-5.6-Sol|59.7%
|🥈|第二名 Kimi K3|58.5%
|🥉|第三名 Claude-Fable-5|57.2%

🔍 更扎心的是,感知相关的幻觉是所有类别里平均表现最差的。模型会「看见」图里根本不存在的东西,或者完全忽略明明就在那儿的细节

还有一个发现挺值得琢磨,有些模型整体跑分几乎一样,但拆开看具体感知能力,差异巨大

🧐 举几个实际题目感受一下。给一张表盘图,问双子座符号在几点钟方向。用红线把图分成九宫格,问哪个区域完全没有树。桌上两个粉色笔筒,问左右分别什么配色什么图案。图里一个红框,问框里有几朵花

这些人类看一眼就能答,模型频繁翻车

📌 坦率的讲,现在大家都在卷推理、卷思维链、卷数学竞赛题,但「看见」这件事本身,可能是个被严重低估的短板。你推理能力再强,感知输入端就是错的,后面全白搭

做多模态方向的朋友建议看看,拿自己模型跑一遍,可能会发现一些意想不到的盲区
#kimi#

发布于 北京