大龙的AGI之旅
26-06-14 17:35

想象你让 AI 画一张"阳光洒在杂乱书桌上的照片"。普通的绘图模型能画出光影和物体,但很难保证台灯真的立在桌子左上角,而笔就在台灯右边两厘米处,透视关系严丝合缝。这就是困境:AI 懂美学,却不懂空间。之前的办法要么需要昂贵的密集深度图数据,要么训练流程复杂得像组装火箭。我们不禁要问,有没有一种更简单、更低成本的方法,能让现有的绘图模型直接学会"空间感"?

作者大胆猜想:只要给模型"施压",让它同时生成图像和深度,就能逼出它脑海中的空间结构。这就是"模态强制"(Modality Forcing)。

通常,我们训练模型时,让它输出图片就完了。但这里,作者做了一件反直觉的事:在训练过程中,强行让模型在生成图片的同时,也输出一张深度图。更妙的是,这个深度监督信号非常"吝啬"——只给出稀疏的点(Sparse Depth),比如图像中几个关键像素点的距离信息,而不是每像素一个值的密集地图。

于是发生了这样的事:模型在生成像素色彩时,不得不时刻"惦记"那几个稀疏的深度点。为了符合这些点,它必须自发地学习物体的大小比例、前后遮挡和透视消失点。这就像教孩子认路,不给他地图,只告诉他"路口左转三步有个红桶",他就能自己推导出整条街的布局。

研究发现,这种方法不仅简单,而且 scalable(可扩展)。它不需要重新设计庞大的网络结构,只需在现有的 DiT(Diffusion Transformer,一种主流绘图架构)训练后期,加上这个"强制"环节。结果令人惊讶:即便只有稀疏的标签,模型也能学会惊人的几何理解。核心概念由此浮现:空间感不是靠"看"出来的,是靠"算"出来的,而"算"的动力来自对多模态一致性的强制约束。

原来,空间理解不需要庞大的几何知识库,只需要在多模态生成时施加一点"一致性压力"。这个角度还能用来审视语音转文字、视频生成音频等任务:只要强制不同模态在底层表征上对齐,或许就能解锁更多隐式的结构能力。

我的看法:这篇论文的聪明之处在于它反过来想——与其拼命堆数据,不如制造信息缺口,逼模型自己把结构学出来。这种"少即是多"的思路在 ML 里越来越常见,比如 contrastive learning 也是靠"不告诉你答案"来学。

论文:http://t.cn/AXaxXFpA
#AI论文解读#

发布于 江苏