#+title: 以图驭深
#+subtitle: Modality Forcing for Scalable Spatial Generation
#+date: [2026-06-14 Sun 11:35]
#+filetags: :paper:
#+identifier: 20260614T113500
#+source: http://t.cn/AXaxLsz6
#+authors: Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski, Justin Johnson, Keunhong Park
#+venue: Carnegie Mellon University / World Labs, 2026
* 问题
想象你在看一张街景照片——左边是一栋红砖楼,右边停着一辆蓝色小车,中间有个人正在过马路。你的眼睛一秒就能判断:楼远、车近、人在车和楼之间。这是人类视觉的本能。
但如果你交给一个最新的大模型去"看"这张照片,它会告诉你:像素的排列方式很美,语义上这里有建筑、车辆和行人。至于谁在谁前面、距离有多远——模型不说,因为它从来不需要说。
这就是困境。文生图模型(比如 FLUX、Stable Diffusion)在海量图片上训练后,确实"学会"了生成逼真的照片——透视、遮挡、远近关系,全在里面。但这些空间知识被锁在模型的"暗房"里,外人看不见。如果你想让模型输出一张深度图(每个像素标注它离相机多远),现有的做法要么需要极其密集的深度标注数据(通常是电脑模拟出来的假数据),要么要用复杂的拼接方案把好几个模型绑在一起。
前人的路走得并不轻松。LDM3D 把 RGB 和深度绑在一起重新训练整个模型;JointDiT 复制一份 U-Net 做深度分支;UniCon 用 LoRA 微调。它们共同的问题是:都需要稠密的、通常是合成的深度数据来训练。真实世界的深度标注极其稀缺——你没法像爬图片那样随便抓几百万张带深度标注的真实照片。
这把尺摆在这儿:领域里最强的深度估计模型(比如 MoGe-2、Depth Anything V2)在真实数据上能做到 AbsRel 大约 3% 左右。而任何试图同时生成图像和深度的生成模型,误差通常在 5-10% 以上——差了将近一倍。
这篇论文的作者看到了一个入口:既然文生图模型已经"知道"了空间关系,为什么不直接让它同时生成图像和深度,用同一个模型、同一组权重,搞定三件事?
* 翻译
这篇论文敢押的命题只有一句话:
给图像的生成过程和深度的生成过程各自独立的噪声进度,让它们在一个模型里并行去噪——这样一个简单的配方,就能让任何文生图模型同时变成深度估计器和联合生成器,而且效果随模型规模线性增长。
听起来简单,但简单背后的设计选择一点都不简单。我们继续用那张街景照片来拆解这个方法是怎么工作的。
[[file:images/20260614T113500--paper-modality-forcing-overview.png]]
**噪声进度:一把双刃的刀**
扩散模型的工作方式是:先在干净图片上加噪声,然后训练一个网络逐步把噪声去掉。传统做法是给整张图一个统一的噪声进度——所有像素一起变脏、一起变干净。
Modality Forcing 做了一个巧妙的改动:它给 RGB 图像和深度图各分配一个独立的噪声进度。想象一下,你手里有两把刷子——一把刷 RGB,一把刷深度。你可以选择:两把同时刷(联合生成),只刷深度而让 RGB 干干净净(深度估计),或者反过来只刷 RGB 而深度完全被遮住(深度到图像)。
不是靠切换模型,不是靠加适配器——仅仅靠调整这两把刷子的速度比例。
**像素空间的深度:绕过 VAE 的墙**
文生图模型通常在"潜空间"(latent space)里处理图像——先把图片压缩成一小段紧凑的表示,再在上面做生成。这个潜空间是为 RGB 设计的,不是为深度设计的。如果你强行把深度图塞进同一个 VAE 编码器,就像把正方形的积木塞进圆形的孔——形状不对,信息就丢了。
更麻烦的是,真实世界的深度标注通常是稀疏的——一张照片里只有部分像素有深度值,其他位置是空的。如果用潜空间做深度,那些空缺的像素怎么办?你没法编码"不存在"的东西。
作者的解法很直接:深度不在潜空间里处理,直接在像素空间里做。深度图就是一个普通的灰度图,每个像素一个值。空缺的像素用高斯噪声填充——等于告诉模型"这里没有数据"。这个看似朴素的选择,让模型可以直接利用稀疏的真实世界深度标注,不再依赖合成数据。
**时间嵌入:两条河流的交汇**
RGB 和深度各自有不同的噪声进度,这意味着它们在每个去噪步骤都处于不同的"时间点"。模型需要知道每个通道当前处于什么进度。
作者的设计是:RGB 复用预训练模型的时间嵌入(因为 RGB 是主干),深度用一个全新初始化的时间嵌入器。但两者不是完全隔离的——它们之间有一个轻量的交叉混合模块,让 RGB 知道深度的进度,深度也知道 RGB 的进度。这个模块从零初始化开始,训练过程中慢慢学会两条流的耦合。
**自蒸馏:不让学生忘了老师的本领**
这是这篇论文最精妙的设计之一。文生图模型在数十亿张图片上预训练过,它的 RGB 生成能力极其强大。如果你直接在上面做深度微调,模型可能会"忘记"它原本擅长的事情——就像学生为了学数学把语文全忘了。
作者引入了一个自蒸馏损失:训练过程中,把当前带噪声的 RGB 输入到冻结的原始 T2I 模型中,记录它预测的速度向量;然后惩罚学生模型(带深度能力的版本)的 RGB 预测偏离这个速度。
关键在于惩罚力度是动态调整的:当深度完全被噪声覆盖时(没有深度信息),惩罚最强——此时 RGB 应该完全按照预训练模型的方式生成;当深度逐渐去噪、开始提供信息时,惩罚减弱——因为预训练模型没见过深度,它不可能给出正确答案,强迫一致反而有害。
**结果:尺上的数字**
把这套方法应用到 FLUX.2-klein-9B(90 亿参数的顶级文生图模型)上,结果令人惊讶:
- 在 NYUv2 数据集上,AbsRel 达到 2.52%——优于所有联合图像-深度生成模型,接近 MoGe-2 的 2.89%
- 相对于之前最好的联合生成模型(JointDiT),误差降低了 57%
- 在 ETH3D 上 AbsRel 2.37%,在 ScanNet 上 2.32%——几乎追平了专业深度估计模型的水准
更关键的是缩放实验:从 3.7 亿参数到 33 亿参数,从 0 到 19 亿张预训练图片,深度精度随模型规模和训练数据量稳步提升。这说明文生图模型中的空间先验是真实存在的、可测量的、并且可以线性提取的。
**反直觉的发现:先生成图像,深度反而更好**
在去噪轨迹的消融实验中,作者发现了一个有趣的现象:先生成 RGB、再生成深度(即让 RGB 先一步去噪),得到的深度图质量更高。作者把这个现象解释为:RGB 在潜空间中的早期生成充当了一个"草稿纸"——模型先生成图像的结构和布局,再基于这个结构推断深度,比反过来更容易。
这和另一项研究(Latent Forcing)的发现一致:在潜空间中遍历比在原始像素空间中更容易。
* 核心概念
**Modality Forcing(模态强制)**
这是论文的核心算法。给每个模态(RGB、深度)独立的噪声进度,让一个扩散模型可以同时支持联合生成、条件生成(图像到深度、深度到图像)三种任务。在街景照片的例子中,这意味着:你输入"一条街道"的文字提示,模型可以同时输出一张逼真的街景照片和对应的深度图——而且深度图的透视关系和照片完全一致。
**像素空间深度扩散**
深度不在 VAE 潜空间处理,而是在像素空间直接扩散。空缺像素用高斯噪声填充。这让模型可以直接利用稀疏的真实世界深度标注(比如从视频序列中估计的 MVS 深度),不再依赖合成数据。在街景例子中,即使照片中只有 30% 的像素有深度标注,模型也能学会推断剩余 70% 的深度。
**自蒸馏正则化**
用冻结的原始 T2I 模型作为教师,在训练过程中惩罚学生模型的 RGB 预测偏离教师。惩罚强度随深度噪声进度动态调整——深度噪声越高(信息越少),惩罚越强;深度噪声越低(信息越多),惩罚越弱。这保证了微调不会破坏预训练模型的核心能力。
* 洞见
这篇论文真正留下的视角是:文生图模型不是"恰好"能生成好看的照片——它们是在学习物理世界的几何结构。当你让一个在数十亿图片上训练过的模型同时生成图像和深度时,它不需要从头学习深度,只需要把已有的空间知识"翻译"成深度格式。
这个视角的价值在于:它暗示我们不需要为每个空间任务(深度、法线、分割、光流)分别训练专门的模型。只要有一个足够强的文生图模型,通过类似的"模态强制"配方,就可以把它扩展为通用的空间感知引擎。图像生成本身就是一个可扩展的空间感知预训练目标。
* 博导审稿
选题眼光:这个困境是真实的。3D 数据稀缺是领域公认的瓶颈,而文生图模型恰好蕴含丰富的空间先验——这个观察点站得住。
方法成熟度:Modality Forcing 的核心预设是"RGB 和深度的去噪可以在同一个 DiT 中并行进行而不互相干扰"。但这个预设有一个未被充分讨论的隐忧:当深度开始提供信息时,RGB 的去噪轨迹会被改变,而深度又依赖于 RGB 的中间表示——这是一个自指的循环。作者通过自蒸馏来缓解这个问题,但没有讨论当深度和 RGB 的预测发生根本冲突时会发生什么(比如深度暗示一个平面,但 RGB 纹理暗示一个凸起)。
实验诚意:缩放实验做得很扎实——控制了模型大小和数据量两个变量,结果趋势一致。FLUX.2-klein-9B 的结果也经得起追问,基线对比全面。但训练数据中 ScanNet 的划分可能存在泄露嫌疑(作者自己承认了)。
声称的分量:"图像生成是可扩展的空间感知预训练目标"——这个声称分量很重。目前证据来自 3.3B 规模的模型和 17M 帧深度数据,距离"可扩展"还差几个数量级。不过作者坦承了这一点,没有过度宣称。
判决:weak accept。方法简洁、实验扎实、洞察有价值,但自指循环的隐忧和缩放外推的谨慎态度让它离"strong"还有一段距离。
* 检验
生活测:想象你是一个建筑师,正在用 AI 生成建筑效果图。你输入"现代玻璃幕墙办公楼,黄昏光线"——Modality Forcing 会同时给你一张效果图和对应的深度图。你看到效果图很满意,然后把深度图导入 Blender 做 3D 场景重建。
命中之处:深度图的质量足够好,重建的 3D 模型轮廓准确,建筑透视合理。
破绽之处:如果效果图中有半透明的玻璃幕墙,深度估计就会模糊——深度模型不知道该把玻璃后面的景物标注为远景还是玻璃本身。这是所有单目深度估计的通病,Modality Forcing 也不例外。
押未来:如果这个命题成立,未来一到两年内,主流的文生图模型(Midjourney、DALL-E、Stable Diffusion 的下一代)会内置深度输出通道——不是作为一个插件,而是原生支持。你生成一张图片的同时,免费获得一张精确的深度图。
* 启发
迁移:如果你有文生图模型的访问权限(比如通过 API),可以用 Modality Forcing 的配方对它做后训练——不需要重新训练整个模型,只需要加一个深度分支和独立的噪声调度。这对任何有 T2I 资源的团队都是一个低成本的升级路径。
混搭:Modality Forcing 的思想可以推广到其他模态——法线图、分割图、光流图。一个模型同时生成图像和任意空间模态,统一训练、统一推理。
反转:传统思路是"先训练深度估计模型,再想办法让它生成图像"。Modality Forcing 反过来——从图像生成出发,深度是副产品。这个方向反转意味着:如果你有强大的图像生成能力,空间感知是免费的.
发布于 江苏
