博主头像

李飞飞发布最新世界模型Atlas | World Labs | 世界模型 | 3D重建 | 视频生成

外来客 • 2026-09-07 06:06:58

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🌐 Atlas模型核心能力与架构

  • 多模态统一处理:Atlas是World Labs发布的新一代世界模型,基于从头训练的多模态自回归扩散Transformer架构。它将文本、图像、视频、相机位姿和3D深度图放入同一序列,建立共享空间上下文。
  • 精确相机控制:区别于传统生成模型依赖文字描述意图,Atlas可直接接收三维空间中的相机位置和角度作为可验证约束。支持设计前进、旋转等具体运动轨迹,并能根据1至6张参考图片生成最长1分钟、1440P分辨率的视频。
  • 空间重建与补全:能从少量(2-3张)甚至超过100张图片中恢复真实世界结构。通过“想象模式”或关闭该模式进行精确重建,输出点云和3D高斯泼溅场景,支持设备端高分辨率渲染。

📊 性能测试与量化指标

  • 相机控制生成优势:在第三方人工评测中,Atlas直接读取精确相机轨迹,而对比模型仅使用文字提示。Atlas对Minimax H3、Gemini Omni Flash、Happy Horse 1.1、Flex 3及C-Dance 2.5的得票率分别为75%、81%、86%、93%和94%,且轨迹越复杂优势越明显。
  • 3D重建精度:在预测输入像素对应3D点的测试中,Atlas平均点图重建误差为千分之25.3,低于Pi3X、VG GT Omega 1B等对比对象。
  • 扩展性验证:团队观察到随着训练计算量增加模型获得新能力,符合Scaling Law预期,但尚未公开具体参数规模、数据量及算力细节。

🤖 机器人仿真与物理交互局限

  • Real to Sim应用:Atlas可从真实环境视频重建空间,模拟机器人在其中移动并生成RGB图像和深度图。支持处理刚性、带关节及可变形成物体,用于改变光照、背景等条件以训练机器人策略。
  • 物理一致性挑战:目前展示主要集中于空间重建和视觉观测生成,缺乏碰撞、摩擦、材料特性及长时间物理演化的系统性测试。视觉上合理的模拟环境在物理上可能错误,尚无法证明能稳定提高真实世界中的策略成功率。

🏢 技术路线对比与行业背景

  • 空间 vs 时间路线:Atlas侧重从空间出发构建稳定场景(搭景师),而Sora、C-Dance等视频模型侧重从时间出发预测物理交互(导演)。两者目前尚未完全融合,Atlas更像生成静态或暂停的场景块,而非持续运行的动态世界。
  • 竞品与演进:谷歌DeepMind的Genie 3、英伟达Cosmos 3及World Labs自家的Marble均涉及多模态世界模型概念。Atlas被视为从单一任务向统一底座推进的关键一步,整合了渲染器与模拟器功能。
  • 团队背景:由李飞飞与Justin Johnson、Ben Mildenhall、Christopher Loper共同创办。Ben Mildenhall是NeRF论文共同第一作者,团队积累集中在视觉图形学和三维表示领域。

博主头像 👤 同一博主

查看该博主全部 84 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。