这是 World Labs 于 9 月 1 日发布的 Atlas 演示成果:用数台普通相机拍下的画面,重构出兼具时间与空间信息的 4D 内容,可自由切换观测视角。
该公司由斯坦福大学李飞飞教授联合创立,Atlas 是继去年 11 月推出 Marble 之后的第二款模型。
它的核心特点是不通过文本指令控制相机。而是直接输入相机位置、角度等几何参数,在像素层面锁定视角;仅需 2‑3 张照片就能重建出 3D 场景,输入上百张照片,重建精度就会相应提升。
模型架构由单个 Transformer 从头开始同步训练文本、图像、视频、3D 四类数据,图像生成与场景重建功能都集成在同一个模型当中。
输出成果支持 1440p 时长 1 分钟的视频、360° 全景图、点云以及高斯泼溅(高斯光斑)。
当一众视频生成公司还在比拼产出精美画面时,这家企业正在把空间本身转化为数据。只用少量照片搭建出三维空间,无论机器人在空间内沿着何种轨迹移动,系统都能输出对应的 RGB 图像与深度信息。这意味着它的目标是打造机器人训练数据工厂。
————————
不知道这是不是物理AI的建模方式? http://t.cn/AX0GrPK7
发布于 湖南
