#Moonshot##Kimi##PerceptionBench##多模态#
【行业动态:Moonshot发布视觉感知诊断基准PerceptionBench,没有一个模型总分达到60%】
Moonshot的Kimi团队发布PerceptionBench,把视觉感知从推理中剥离出来单独评估。构建方式值得一说:团队把40多个基准上前沿模型的失败逐一归因到最早的视觉原因,从真实的失败模式里反推出10项感知能力,而不是预先定义一套分类,最终形成3000道验证过的题目,每题看一眼就能答,不需要推理也不需要外部知识。
结果是一张不太好看的成绩单。没有任何模型总分达到60%:GPT-5.6-Sol以59.7排第一,Kimi-K3 58.5,Claude-Fable-5 57.2,Gemini-3.1-Pro 56.2,GPT-5.5 55.8。团队还指出两件事:总分接近的模型,感知能力的强弱项分布可能完全不同;更要紧的是,相当一部分答对的题在重复提问下答不对,说明模型很多时候是在猜,不是在看。各源基准之间的覆盖重叠也很弱,平均成对加权Jaccard只有0.20,意味着没有哪个基准能代表感知的全貌。
需要提醒的是,这是Kimi自建自评的基准,其自家Kimi-K3在榜上排第二,读数时要有折扣。但"重复提问就答不对"这个发现,独立于榜单排名,指向的是多模态评测里一个长期被忽略的问题:分数没有区分"看见了"和"蒙对了"。对要把多模态模型放进质检、医疗影像、自动驾驶这类场景的企业,这个区别是致命的。
发布于 北京
