#全球首个多模态世界模型发布#【AI教母披露“里程碑式”成果!#全球首个多模态世界模型来了# 可用于机器人预训练】《科创板日报》9月2日讯, 科幻寓言《平面国》中,主角生活在2D的平面世界,后被3D球体带入空间国,才知晓高度的存在。如今,AI也有望迎来类似的顿悟时刻。
9月2日,“AI教母”李飞飞旗下创企World Labs发布了“全球首个多模态世界模型”——Atlas,该模型不再满足于生成图片、文字,而是可生成具有像素级精确的图像和视频帧,并将其重建为3D世界。
Atlas的核心能力围绕“理解与模拟3D世界”展开,旨在让AI真正理解3D世界的物理法则和几何结构,而不仅仅是生成看起来合理的2D画面,底层创新在于用“空间上下文”(Spatial Context)替换“文本上下文”。
不同于大模型处理文本上下文,Atlas采用多模态自回归扩散Transformer架构,将输入的每一张图片和视频都锚定在三维空间中的一个精确位置,并附有相应的相机位姿和深度信息。这相当于给模型提供了一个带有“坐标轴”和“比例尺”的三维草稿本,让AI在理解世界时有了明确的几何和物理参考。(编辑 宋子乔) http://t.cn/AX05fABh
