#how i ai#
Kimi 发布 PerceptionBench , 16 个前沿模型,没有一个及格
Kimi 团队今天放出了 PerceptionBench ,一个专门测试多模态大模型,纯视觉感知能力的基准测试,考查模型看见了什么。结果是,所有被测模型没有一个超过60%准确率。
测的内容关于什么?
题库里面有 3000 道题,覆盖 10 项原子视觉能力:视觉关系识别、计数、属性判断、深度与3D 感知、定位、比较、细粒度识别、上下文整合、OCR、幻觉检测。
每道题的标准是,只靠看就能答对,不需要推理,不需要外部知识。
这 10 个分类是从 40 多个现有基准测试中,把模型的失败案例一层层追溯到最早的视觉错误环节,归纳出来的。
排名前五
GPT-5.6-Sol 59.7%
Kimi-K3 58.5%
Claude Fable5 57.2%
Gemini-3.1-Pro 56.2%
GPT-5.5 55.8%
再往后还有 Gemini 3.5 Flash 、Qwen3.7 Plus 、Qwen3.5 、Claude Opus 4.8 、Kimi K2.6 、Grok 4.5 等。
几个值得注意的点
第一,总分接近不等于能力相同。 GPT-5.6-Sol和 Kimi-K3 总分只差 1.2% ,但细分到 10 个子维度上各有强项弱项。比如 Kimi-K3在定位( Loc )上拿到 70.6% 全场最高, GPT-5.6-Sol 在视觉关系( VRel )上 69.7% 领先。
Claude Fable5 在幻觉检测( Hallu )上以 64.3% 排第一。
第二,大量正确答案是猜对的。 测试发现一个现象,同一个问题问两遍,很多第一次答对的第二次就错了。这说明当前模型很多时候不是真正看见了答案,而是在概率性地猜测。
第三,幻觉检测普遍拉胯。 所有模型在 Hallucination( 幻觉 )这一项得分最低的一批里, Qwen3.5 只有 26.9% , Claude Opus 4.8 是 38.7% 。这意味着模型经常看到图中根本不存在的东西。
第四,国产模型表现可圈可点。 Kimi-K3 拿下第二名, Qwen 3.7Plus 排在第 9 ,整体来看头部国产模型已经能和 GPT 、 Claude 、Gemini 站在同一梯队。但中后段差距仍然明显, GLM-4.6V 以 32.5% 垫底。
