智象未来(HiDream.ai)近日发布全球首款原生全模态交互式世界模型HiDream-O1-World,首次让AI从“生成视频”跨入“可进入、可交互、可持续推演”的虚拟世界,本文拆解其实现长时空一致性与物理响应的底层机制。
一、从“生成画面”到“生成世界”的范式跨越
产品定位:8月17日发布的HiDream-O1-World提供漫游、编辑、交互三种模式,用户可第一人称自由探索、通过文字指令实时修改场景(如“把船变成茶杯”),也可驱动角色完成奔跑、跳跃等动作。
核心突破:画面运动不再依赖像素统计,模型需同时处理几何、光照、材质到物理逻辑的全局统一,每一次交互都要求物理真实、音视频同步。
关键体验:用户转身后场景不刷新、物体不漂移,这是交互式世界模型区别于普通视频生成的核心分水岭。
二、长时空一致性:UiT统一架构与“记忆+在线适应”双机制
原生全模态UiT架构:摒弃传统“文本编码器+图像VAE”的拼接方案,将图像像素、文本Token、视频体素、音频、动作、空间坐标统一映射进同一共享Token空间,由同一套Transformer完成理解—生成—推理。
Memory 3D先验记忆:模型在生成画面时同步维护一张“空间地图”,保存几何结构、物体位置与空间关系,实现“人走世界不刷新、回头场景不重构”。
TTT测试时训练:推理过程中根据相机轨迹和场景状态动态适配,每一次视角切换都重新校正对世界的理解,使生成结果实时贴合3D几何约束。
学术验证:相关研究《DreamWorld》采用Geometry-then-Appearance两阶段框架,先推演目标视角几何结构再合成画面,已被ECCV 2026录用。
三、物理响应:数据驱动训练与在线物理适配
物理数据训练:引入刚体碰撞、流体流动、柔性形变、重力抛射等高难度物理模拟数据,让模型从训练阶段学习物体间的运动与因果关系。
在线物理适配:推理时通过TTT机制针对陌生环境动态微调,确保物体碰撞、遮挡、重力响应符合现实世界因果逻辑。
第三方评测登顶:在美团LongCat与复旦联合推出的WBench基准中,该模型物理维度得分73.3排名第一,一致性维度88.0,综合登顶Navi分榜。
四、迈向“可交互世界”的产业意义
应用前景:HiDream-O1-World可用于AI互动影游、机器人虚拟训练、3D场景生产等领域,智象未来已与诺亦腾机器人合作,预计年内生成数万小时具身智能训练数据。
战略判断:真正的世界模型需同时具备表达世界、推演世界、构造世界三重能力——从“model the world”到“mold the world”。