来客网

世界模型的新思路:原生一体,整视频流

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

VAST,香港大学和PICO开源了一个双目世界模型——StereoWorld。

与现有“先生成单目视频,再估计深度、变换视角并修补遮挡”的多阶段方案不同,StereoWorld从生成开始便同时建模左右视图,使视觉外观与双目几何在同一模型中共同演化。

更重要的是,StereoWorld的训练不依赖显式深度监督。模型仅使用RGB双目视频,便能从左右视图之间的视差中学习稳定的几何关系。

世界模型看起来很真实,为什么仍然不够“懂三维”?

近年来,视频生成模型已经能够合成高度逼真的动态画面,进一步加入相机轨迹或动作指令后,模型还可以向前移动、转向或探索新的视角,因此逐渐具备了“世界模型”的雏形。但大多数现有世界模型仍然通过单目RGB视频表示世界。

单张图像并不能唯一确定三维结构,同一个物体究竟是“体积很小但距离很近”,还是“体积很大但距离很远”,在二维画面中可能产生相同的投影。因此,单目模型中的深度通常是隐式且尺度不确定的。当相机持续移动时,这种不确定性还可能不断累积,最终表现为空间结构漂移、物体形状改变,甚至凭空出现原本不存在的内容。

另一类方法会额外生成深度图,构建RGB-D世界模型。但深度图与大规模RGB视频预训练模型之间还存在明显的模态差异;与此同时,由于误差累积,使用单目得到的depth warp后再inpaint得到novel view的方法往往会丢失视频中的细节信息(如下图中的铁丝网)。

△左:单目depth warp+inpaint;右:StereoWorld双目生成

双目视觉则提供了另一条路径。人类通过左右眼观察到的细微位置差异感知距离,当相机焦距和双目基线已知时,视差可以直接关联到真实尺度下的深度。因此,双目图像不仅多提供了一张画面,更为模型提供了一个稳定的三维“物理锚点”。

StereoWorld的出发点正是:与其让世界模型在生成完成后再猜测深度,不如让它从一开始就用“双眼”观察和生成世界。

双目视频生成

给定单张图像、场景文本描述,以及WASD键控制的平移和上下左右键控制的方向,StereoWorld通过统一建模相机与视频帧RoPE编码的方式,同时生成后续的左眼视频和右眼视频。结果如下:

0

评论 (0)