World Labs 发布 Atlas:3 台 iPhone 可生成《黑客帝国》式子弹时间

World Labs 发布 Atlas:3 台 iPhone 可生成《黑客帝国》式子弹时间

N
News Editor
2026-09-05 10:53:04
李飞飞参与创立的 World Labs 推出新一代世界模型 Atlas,主打同时进行生成、重建与模拟。公司称,Atlas 可利用最少 3 台相机获取的画面与相机姿态信息,生成类似《黑客帝国》「子弹时间」的环绕视角。该模型还试图把 3D 重建与生成式 AI 合并到同一体系中,把部分场景采集需求从数百张照片降到少量图像,并将应用从影视、游戏延伸到建筑、工业设计和机器人模拟。

World Labs 近日发布新一代世界模型 Atlas。团队称,这一模型不只是生成视频,而是能够同时完成「生成、重建与模拟」,并通过相机位置、图像与 3D 空间信息来理解场景。

官方展示中,一个最直观的案例是经典电影《黑客帝国》的「子弹时间」效果。过去,拍摄 Neo 后仰躲子弹、镜头围绕人物旋转的画面,通常需要在绿幕摄影棚布置数百台相机,从不同角度同步采集。World Labs 表示,Atlas 最少只需要 3 台相机,甚至只需把 3 部 iPhone 固定在三脚架上拍摄,就可以重新生成摄像机环绕场景的不同视角。

团队举例称,无论是人物投篮,还是草莓落入牛奶后溅起液体,只要从几个角度拍下画面,Atlas 就能让虚拟摄像机进入原本没有真实拍到的位置,重新生成「时间冻结后镜头穿行其中」的效果。

把空间理解放进视频生成

World Labs 认为,Atlas 与当前主流 AI 视频模型最大的区别,在于输入图像具备明确的空间意义。一般生成式视频模型接收一张图片后,会依靠模型自身对场景的理解进行推测,再结合文字提示词控制输出。Atlas 的做法则是,把每张图像与对应的 3D 相机姿态绑定。

这意味着,模型不只知道「这是一张房间照片」,还知道这张照片是从房间中的哪个位置、以什么角度拍摄的。多张图像由此共同组成 World Labs 所说的 Spatial Context,也就是空间脉络。

在这个基础上,用户可以把一台虚拟摄像机放入场景中的任意位置与时间点,让 Atlas 预测从该位置看出去的世界会是什么样子。World Labs 将这一机制称为 New View Prediction,并认为它可能成为空间智能的基础能力之一。

将 3D 重建与生成式 AI 合并到同一模型

Atlas 的另一项变化,是 World Labs 试图整合长期分开的两个计算机视觉方向:3D Reconstruction 与 Generative AI。

传统 3D 重建强调忠实还原现实世界,往往需要大量照片,从不同角度对同一物体进行三角测量;生成式 AI 则擅长生成原本不存在的内容。World Labs 的判断是,真正理解空间的 AI,需要同时具备这两种能力。

因此,Atlas 在预训练阶段就原生支持文字、图片、视频、相机姿态和 3D 信息。目前,3D 信息主要通过 Depth Map,也就是深度图来表示,让模型同时获得画面的 RGB 像素内容以及背后的空间结构。

李飞飞表示,这意味着计算机视觉中长期分开发展的「像素生成」与「3D 重建」开始走向统一。对 World Labs 来说,核心在于生成真正具有空间脉络、同时受几何结构约束的像素,这也是公司迈向 Spatial Intelligence 的一步。

拍摄量从数百张降到几张

这项技术也可能改变 3D 内容制作的成本结构。传统 NeRF、Gaussian Splatting 等 3D 重建流程,常见问题之一是需要 Dense Capture,也就是高密度采集。

World Labs 联合创始人、NeRF 作者之一 Ben Mildenhall 举例说,要完整扫描一个房间,可能需要拍摄 100、200 甚至 300 张照片,因为桌底、椅脚之间、植物叶片后方等区域都需要足够图像覆盖。对没有经验的用户来说,扫描多个房间的空间,甚至可能耗费一两个小时。

Atlas 的目标,是把这件事从数百张照片降到几张照片。Mildenhall 表示,团队正尝试把所需拍摄量降到约 3 张图像,并称这可能相当于 50 至 100 倍的数据量下降。

原因在于,Atlas 可以先用真实图像重建能够确定的部分,再利用生成能力补足从未被相机拍到的空间。

在 World Labs 展示的斯坦福校园案例中,模型只使用地面拍摄的 3 至 25 张照片,就能生成从空中观看校园的视角;而一些原本需要约 2,000 张照片才能重建的多房间场景,团队称目前可以缩减到约 30 至 40 张输入图像。

这也是生成式 AI 与 3D 重建结合的意义所在:如果某个区域从未被镜头拍到,传统重建通常只能留下空洞;而生成模型可以根据空间上下文推测缺失内容。

从影视与游戏延伸到建筑和工业设计

World Labs 表示,Atlas 首批最直接的落地场景仍是内容产业。公司上一代产品 Marble 已经可以把图片、视频或文字转换成 Gaussian Splat 3D 世界,但团队观察到,很多创作者的真实使用路径其实是:输入一张图,生成完整 3D 场景,从不同角度截图,然后离开 Marble。

这让团队意识到,创作者未必需要完整的 3D 资产,Atlas 因而把 New View Prediction 直接做成模型核心能力。

这一点对电影、广告、游戏和视觉设计尤其关键。World Labs 指出,现在不少 AI 图片和视频模型虽然也能生成不同视角,但场景中的家具、人物和物体位置往往会随生成结果漂移。公司希望构建的是一个「Persistent 3D State」:物体的位置与身份能够持续存在,创作者只是在移动摄像机,而不是每次都重新抽取一次生成结果。

在此基础上,World Labs 认为,这套能力还可以扩展到建筑、施工、展陈设计和工业设计。

更长期目标指向机器人

不过,Atlas 更大的目标并不是好莱坞,而是机器人。World Labs 此前收购机器人公司 Cinex,其核心技术之一就是 Real-to-Sim 与 Sim-to-Real。

例如,企业如果要训练机械臂进行线材组装,通常需要先把真实工厂环境重建成模拟环境,再让机器人进行大量训练。但建立这类模拟环境的成本很高。

李飞飞表示,目前机器人产业最大的难题其实是数据。真实世界中的机器人操作数据难以获得,而且模型不能只学会一种标准情况。一根电线可能朝不同方向弯曲,箱子可能有不同尺寸和颜色,物体也可能位于场景中的不同位置,因此模拟环境还需要进行大量 Domain Randomization,生成各种变化。

World Labs 认为,Atlas 的 Sparse Reconstruction 能力,正好可以降低把真实世界转换成模拟环境的成本。

从更长期看,World Labs 希望 Atlas 不只是用于建立模拟环境,而是本身成为 Neural Simulator。如果模型能够理解「对世界采取某个动作之后,世界接下来会变成什么样子」,它就可以模拟机器人在真实环境中可能遇到的异常情况。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。