照片加镜头路线,补全 3D 场景
李飞飞创办的 World Labs 发布了名为 Atlas 的多模态世界模型。官方称,这是全球首个能精确控制镜头生成图像和视频,同时完成 3D 重建的模型。
最直观的玩法有点像全景无人机,但 Atlas 不需要真的把四周都拍下来。给它一到几张照片,再画一条镜头路线,模型就能自己补出没拍到的墙后、物体背面和周围空间,让虚拟镜头沿着指定路线飞过去。Atlas 最高能生成 1 分钟、1440p 视频。
相机位置是核心
普通视频模型主要根据文字或图片继续生成像素,镜头运动也通常靠「左移」「推进」这类文字描述。Atlas 会直接读取相机在 3D 空间里的位置和角度,还能生成深度和完整 3D 场景。输入照片越多,它需要自己脑补的地方就越少。
这也是 World Labs 把它叫「世界模型」的原因。它不只是在猜下一帧长什么样,还要知道相机在哪里、物体在哪里、换个角度应该看到什么。
World Labs 还用它把真实空间变成机器人训练用的仿真环境。Atlas 目前只向部分合作伙伴开放。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

