大龙的AGI之旅
26-06-04 17:55

最近看到个挺有意思的基准测试叫 OVO-S-Bench,专门考多模态大模型的“流式空间智能”。简单说就是让模型像人一样,从第一人称连续视频流里理解周围的空间布局,而且很多证据画面已经过去了你得自己记得。他们找人标了1680个问题,问题还分了四个难度等级。

结果发现,即便是像 Gemini-3.1-Pro 这样的模型,和人类专家的差距也有27分,主要栽在最抽象的“整体空间地图构建”上。有个挺反直觉的发现:那些专门为“看懂空间”做过微调的模型,反而比没调过的基座模型表现更差。用思维链一步步想也没用,如果模型本身对流式信息的理解不扎实,推理过程反而会错得更离谱。

感觉这给目前多模态模型的空间能力泼了盆冷水,光靠事后优化可能不够,得从底层处理方式上下功夫。

论文链接:http://t.cn/AXXiA3FL

#深度学习

发布于 江苏