【#Kimi发布视觉感知基准PerceptionBench#】
Kimi.ai 发布 PerceptionBench,一个专门评估视觉感知能力的基准测试,从当前前沿模型的失败模式中归纳而来。
该基准将视觉感知拆解为 10 种原子能力,构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
PerceptionBench 的设计思路是,如果模型在某个感知任务上失败,就能精确定位是哪一种原子能力不足。这种细粒度拆解有助于理解模型的能力边界,为改进提供明确方向。
基准数据集和评估方法已公开,研究者和开发者可自行测试模型表现。
发布于 北京
